Następna era rywalizacji o kamery: istotą wyścigu jest ich zdolność do zrozumienia.

Wyścig aparatów fotograficznych zmienia się tak, że coraz ważniejsze staje się zrozumienie sceny i robienie inteligentnych zdjęć wspomaganych przez sztuczną inteligencję, wykraczających poza same specyfikacje techniczne.

Najważniejsze rzeczy, które musisz wiedzieć

  • Funkcja czujnika przesuwa się z rejestrowania pięknych obrazów dla ludzkiego oka na dostarczanie czystych sygnałów, które mogą być przetwarzane przez maszynę, co sprawia, że ​​jest on niezbędnym narzędziem percepcji.
  • Wąskim gardłem w przetwarzaniu AI w czasie rzeczywistym staje się czujnik, co wymusza stosowanie takich rozwiązań, jak przetwarzanie na chipie, czujniki oparte na zdarzeniach, uniwersalne migawki i zmodyfikowane technologie HDR w celu zwiększenia czytelności maszynowej.
  • Kolejny konkurs na rynku aparatów fotograficznych będzie dotyczył zintegrowanego systemu obejmującego czujnik, przetwarzanie obrazu i przetwarzanie peryferyjne, ze szczególnym naciskiem na „jakość wnioskowania” jako priorytet strategiczny wykraczający poza tradycyjną „jakość obrazu”.

Demonstracja, która mnie przekonała, miała miejsce w galerii sztuki, którą sam zbudowałem.

Nie mogliśmy zapewnić zespołu przewodników, więc stworzyłem projekt poboczny, który miał ich zastąpić. Nie było pola wprowadzania danych ani niczego do pisania. Kierowało się telefon na jakiś obszar, a on informował, co się ogląda. Wystawa się skończyła, ale ludzie i tak z niej korzystali.

Kierowali go w stronę budynków, kwiatów, zabawek swoich dzieci, plakatów na ulicy. Żadna z tych rzeczy nie miała nic wspólnego z wystawą.

Bez niczyjej prośby postanowili, że kamera powinna im objaśniać świat.

Spełnienie tych oczekiwań jest obecnie obowiązkiem branży. Ma to miejsce w momencie, gdy sztuczna inteligencja przechodzi od problemu szkoleniowego do problemu wnioskowania, gdzie większość rzeczywistej pracy jest wykonywana na samym urządzeniu, podczas gdy użytkownik kieruje swój telefon w stronę niekooperującego, rzeczywistego świata.

Modelka potrzebuje w kadrze innych elementów niż Twoje oko: krawędzi, na których może się oprzeć, i struktury, którą może odzyskać, gdy ujęcie jest pełne blasku lub rozmycia. Kolory i kontrast, które sprawiają, że zdjęcie wygląda dobrze, często stanowią dla modelki przeszkodę.

Czujnik, którego potrzebujesz dla człowieka i czujnik, którego potrzebujesz dla modelu, wymagają różnych konstrukcji.

Czujnik stał się problemem percepcji, a ludzie, którzy budują systemy wizyjne w czasie rzeczywistym, martwią się nim teraz tak samo, jak kiedyś fotografowie.

Skąd pochodzi czujnik?

Aktywny pikselowy czujnik CMOS, wynaleziony przez Erica Fossuma i opracowany na początku lat 90. ubiegłego wieku, to powód, dla którego dziś w niemal każdej kieszeni mieści się odpowiedni aparat fotograficzny.

Jego późniejsze prace zmierzają w zupełnie innym kierunku: kwantowy czujnik obrazu, który zlicza pojedyncze fotony. Ta trajektoria ilustruje to, co dzieje się obecnie ze sztuczną inteligencją: od przechwytywania klatki, która mogłaby się spodobać człowiekowi, do przechwytywania najczystszego sygnału do przetworzenia przez maszynę.

Czujnik staje się narzędziem percepcji, a fotografia jest tylko jednym z jego zastosowań.

Dlaczego rozumowanie zmienia naturę pracy?

To wnioskowanie sprawia, że ​​problem jest pilny. Wcześniej, gdy sztuczna inteligencja skupiała się głównie na szkoleniu, rola kamery była pośrednia: generowała dane, które następnie, w spokojnym tempie, można było kategoryzować i wyciągać z nich wnioski. Wnioskowanie nie jest powolne. Odbywa się na żywo, na urządzeniu, które jest niedostatecznie wydajne i już mocno eksploatowane, jak to ma miejsce w przypadku aplikacji AI, w których liczy się czas.

Kiedy system musi rozpoznać coś, podczas gdy kamera jest wciąż na niego skierowana, i zareagować, zanim będzie za późno, najsłabszym ogniwem jest to, co trafia do modelu i to ono wyznacza granice wszystkich możliwości produktu.

Część branży wciąż stawia na niewłaściwą rzecz. Zakłada się, że wystarczająco duży model oczyści wszystko, co przekaże mu kamera. Widziałem, jak to utrudniało plany rozwoju produktów przez dwa lata z rzędu i nie sądzę, żeby to było sprzeczne z prawami fizyki.

Żaden model nie jest w stanie odtworzyć szczegółów zniszczonych przez rozmycie ruchu, odblaski ani tych utraconych w procesie przetwarzania z priorytetem piękna, zanim model zobaczy klatkę. Wąskie gardło przesuwa się teraz w górę, w kierunku czujnika i tego, co znajduje się między nim a modelem.

Co właściwie robią te urządzenia?

Niektóre czujniki wykonują obecnie część przetwarzania na samym chipie, więc wstępne obliczenia następują, zanim dane opuszczą matrycę pikseli. Czujniki oparte na zdarzeniach, czasami nazywane neuromorficznymi, rejestrują tylko zmieniające się fragmenty sceny, co jest znacznie lepiej dostosowane do percepcji w czasie rzeczywistym niż strumieniowanie pełnych klatek. Migawki globalne pomagają również, redukując zniekształcenia ruchu, które mogą zaburzać odczyty maszynowe.

Nawet technologia HDR (High Dynamic Range), od dawna zaprojektowana do spektakularnego odwzorowywania nieba, jest teraz kalibrowana, aby dopasować ją do tego, co model może wyraźnie odczytać w warunkach wysokiego kontrastu. Pomimo różnic, wszystkie te technologie zmierzają w tym samym kierunku: w kierunku wersji świata, którą model jest w stanie obsłużyć.

Od identyfikacji do wniosku

Najbardziej intuicyjnym sposobem na zbudowanie jest wyszukiwanie wizualne: skieruj aparat na coś, a pojawi się etykieta. Ale kiedy kierujesz telefon na menu, chcesz pomóc w podjęciu decyzji, co zjeść; kiedy kierujesz go na plakat, przydatnym krokiem może być zapisanie wydarzenia w kalendarzu. Rozpoznawanie obiektów to dopiero punkt wyjścia. Istota produktu tkwi w wiedzy o tym, co powinno się wydarzyć. To właśnie tutaj czujnik staje się pierwszym ogniwem w dłuższym łańcuchu interpretacji, wykraczającym poza samo rejestrowanie informacji.

Nigdy nie planowałem stworzenia aparatu fotograficznego; początkowo był to tani sposób na uniknięcie zatrudniania przewodników na jedną wystawę. Ale ten mały projekt pokazał mi, że ten instynkt już we mnie tkwi. Kolejne wyzwanie w świecie aparatów fotograficznych będzie dotyczyło całego systemu: czujnika, ścieżki przetwarzania obrazu, przetwarzania peryferyjnego , formatowania modelu i tego, co system ostatecznie robi.

Producenci sprzętu poświęcili lata na poprawę jakości obrazu i będą musieli traktować jakość wnioskowania równie poważnie. Twórcy oprogramowania nie mogą traktować przechwytywania jako problemu kogoś innego: sposób przechwytywania i kierowania sygnału kształtuje wynik na długo przed tym, zanim użytkownik go zobaczy. Stare granice między sprzętem a oprogramowaniem tracą na znaczeniu w miarę pogłębiania percepcji w czasie rzeczywistym.

Wciąż jest tu miejsce dla startupów. Ich przewagą jest szybkość identyfikacji: sformułowanie problemu, zanim duzi gracze zakończą o nim dyskusję. Sama zdolność ogólnego modelu staje się coraz trudniejsza do obrony. Pytanie brzmi: co się stanie, gdy pojedynczy system będzie w stanie przewidzieć, przewidzieć i zareagować na to samo zdarzenie, i kto pierwszy dotrze do celu z w pełni funkcjonalnym produktem?

Ludzkie oczy kontra umysły maszyn

Obstawiam, że w ciągu najbliższych kilku lat firmy podzielą się na dwa obozy: te, które optymalizują wydajność pod kątem ludzkiego oka, i te, które optymalizują wydajność pod kątem tego, co maszyna powinna odczytać. W przypadku flagowego telefonu cele te wciąż pokrywają się na tyle, że różnica między nimi zaciera się.

Jednak strategicznie cele te już zaczęły się rozchodzić. Najbardziej zrównoważonym stanowiskiem będzie ten, kto potrafi przekształcić chaotyczny świat rzeczywisty w najczystszy sygnał, jaki maszyna może wywnioskować.

Wszystko zaczyna się od czujnika.

Przejrzeliśmy, oceniliśmy i sklasyfikowaliśmy najlepsze telefony z aparatem.

Możliwość dodawania komentarzy nie jest dostępna.