Rozmawiam ze swoim komputerem: niesamowity komfort i zażenowanie!
Czy zdarza Ci się rozmawiać z komputerem? Odkryj niesamowitą wygodę poleceń głosowych i zażenowanie, jakie mogą one powodować. Czy to normalne? Przekonaj się!
Najważniejsze rzeczy, które musisz wiedzieć
- Technologia dyktowania głosu, np. Wispr Flow, pozwala pisać długie artykuły z zadziwiającą szybkością. Autor może napisać 500 słów w mniej niż sześć minut, zachowując przy tym dużą dokładność, nawet jeśli nie jest to język ojczysty użytkownika języka angielskiego.
- Eksperci, tacy jak Bill Gates i Sam Altman, wierzą, że interakcja głosowa to przyszłość informatyki, dzięki której użytkownicy będą mogli sterować urządzeniami przy użyciu codziennego języka, bez konieczności korzystania z wielu aplikacji.
- Mimo wygody dyktowania głosowego, mówienie do komputera w miejscu publicznym może być krępujące, ale darmowe i dokładne aplikacje, takie jak Willow Voice, oferują praktyczną alternatywę.
Dekadę temu Google wprowadził pisanie głosowe w aplikacji Gboard na Androida, a rok później funkcja ta pojawiła się na iPhone'ach wraz z aplikacją klawiatury. Nigdy nie zwracałem na nią większej uwagi. Głównym powodem była jej niewystarczająca dokładność.

Obiecano mi zupełnie nowy sposób interakcji z telefonami, ale nigdy nie był on na tyle dobry, żebym przestał stukać i przesuwać palcem po klawiaturze ekranowej. Oto jestem w 2026 roku i rozmawiam z komputerem. Właściwie cały ten artykuł został podyktowany, skopiowany i wklejony do WordPressa.
Edycje, które musiałem wprowadzić, polegały na wstawieniu kilku przecinków, rozdzieleniu dwóch zdań kropką i przekształceniu kilku punktów w spójne zdanie. Gdybym miał to zmierzyć, powiedziałbym, że tylko 2% wysiłku włożonego w napisanie tego artykułu poświęciłem na wpisanie tych zmian.
To wszystko. Ale faza miesiąca miodowego kończy się bardzo szybko, gdy zaczyna pojawiać się świadomość społeczna.
Mocny początek

Zacząłem korzystać z dyktowania głosowego po wypróbowaniu Wispr Flow. Jest niesamowicie dokładne. A kiedy mówię „niesamowicie dokładne”, mam na myśli kogoś, dla kogo angielski nie jest językiem ojczystym i kto nie ma wyraźnego amerykańskiego ani brytyjskiego akcentu. Mimo to, za każdym razem, gdy piszę artykuł, jestem zdumiony, jak dokładny i łatwy jest cały proces.
Jednocześnie uczyniło mnie to niesamowicie leniwym, a jednocześnie o wiele bardziej produktywnym.
Prowadzę redakcję, co oznacza, że szybkość to jedyny sposób na osiągnięcie nagrody w postaci wysokich pozycji w wynikach wyszukiwania i dużej widoczności w Google. Właściwie to była pierwsza lekcja, której się nauczyłem, zaczynając pracę dziennikarską w jednej z najbardziej szanowanych redakcji w Indiach. „Szybkość to siła napędowa biznesu” – mawiał mój pierwszy redaktor naczelny, a to jest praktycznie wpisane w mój sposób pracy.
Stosowałem się do tej zasady co do joty. Ale odkąd zacząłem korzystać z Wispr Flow, jestem zdumiony, jak szybko mogę teraz pisać i publikować najnowsze wiadomości. Wczoraj wieczorem udało mi się napisać artykuł liczący około 500 słów w niecałe sześć minut. Mógłbym to zrobić jeszcze szybciej, gdyby angielski był moim językiem ojczystym, ale sześć minut to i tak niesamowicie szybko, jak na dzisiejsze standardy.

Ta niesamowita wygoda kompletnie mnie rozleniwiła. Za każdym razem, gdy muszę dotknąć klawiatury, żeby wykonać zadanie, którego nie da się wykonać za pomocą pisania głosowego, odczuwam wyraźny opór. Myślałem, że klawiatura Chiclet w moim laptopie w końcu straciła swoją magię.
Aby przetestować tę teorię, wypróbowałem klawiaturę niskoprofilową, a następnie przeszedłem na mechaniczną, mając nadzieję, że rozpali to we mnie na nowo miłość do pisania. Myliłem się. Z klawiaturami też nie było problemu. Gdybym pisał krótko i nieregularnie, niewątpliwie cieszyłbym się płynnym dźwiękiem i przyjemnym dotykiem. Stałem się beznadziejnie uzależniony od narracji w moich artykułach i swobodnego mówienia, aby wykonywać codzienne zadania redakcyjne.
Proroctwo się spełniło
Czy to przyszłość informatyki? Wydaje się, że tak. Ale wciąż daleka od ideału. Pisanie głosowe jest nadal przeznaczone do zadań wymagających pisania długich wersji roboczych lub kierowania zadaniami za pomocą agenta AI, takiego jak ChatGPT lub Gemini. Dolina Krzemowa jest całkowicie przekonana do tej idei i stworzyła nawet termin znany jako „voice-pilled” (ang. „zapis głosowy”).
Niestety, uważam się za osobę, na którą wpływa technologia dźwięku.
Za każdym razem, gdy staję przed tym dylematem, wracam do notatki Billa Gatesa z 2023 roku. Napisał : „Nie będziesz musiał używać różnych aplikacji do różnych zadań. Po prostu powiesz swojemu komputerowi, w codziennym języku, co ma robić”, dokładnie rok po tym, jak ChatGPT został po raz pierwszy udostępniony publicznie i zrewolucjonizował informatykę.
Powiedz mi, że używasz @WisprFlow , nie mówiąc mi, że używasz @WisprFlow https://t.co/4vKJF8jFX6
— Wispr Flow (@WisprFlow) 24 czerwca 2026
W maju ubiegłego roku Sam Altman, prezes OpenAI, firmy, która opracowała ChatGPT, udzielił wywiadu Sequoia i podzielił się przemyśleniami na temat głosu jako nowego obszaru interakcji człowiek-komputer. Oto jego cytat:
Uważam, że interakcja głosowa jest kluczowa. Szczerze mówiąc, nie udało nam się jeszcze stworzyć naprawdę dobrego produktu głosowego. To zrozumiałe; stworzenie dobrego modelu opartego na tekście zajęło nam trochę czasu. W końcu pokonamy to wyzwanie i myślę, że kiedy to zrobimy, znacznie więcej osób będzie chciało korzystać z interakcji głosowej.
Mniej więcej w tym samym czasie Wispr Flow zaczął zyskiwać popularność. Wypróbowałem go na poważnie po raz pierwszy, gdy pojawił się na iPhone'ach, a później zainstalowałem na moim Macu. Tak, limit dyktowania na darmowych kontach był nieco frustrujący, więc na krótko wypróbowałem płatną subskrypcję.
W końcu anulowałem subskrypcję i zacząłem korzystać z aplikacji na Androida , która oferowała nielimitowane dyktowanie głosowe dla darmowych kont w ramach promocji ograniczonej czasowo. Kilka tygodni temu przeszedłem na Willow Voice, która jest niemal tak samo dokładna i całkowicie darmowa. Od tamtej pory nie żałuję.
Moje człowieczeństwo i niepokój świata
Pisanie nadal wydaje mi się męczące i pomimo irytujących błędów ortograficznych wynikających z mojego akcentu, nadal zdarza mi się naciskać klawisz fn przez dłuższy czas, aby napisać artykuł, napisać długą wiadomość do członków zespołu lub nawet przeprowadzić zwykłą rozmowę z Claudem na temat moich osobistych projektów.

To daje poczucie wolności, ale jednocześnie frustruje mnie za każdym razem, gdy wracam do zadania wymagającego ręcznego pisania na klawiaturze.
Tutaj sytuacja staje się dla mnie nieco niezręczna. Nie ma znaczenia, czy pracujesz w biurze, czy jesteś jedną z tych osób, które codziennie zabierają laptopa do pobliskiej kawiarni. Jeśli jesteś osobą, która wpatruje się w ekran laptopa i rozmawia przez długi czas, wygląda to po prostu dziwnie.
Teraz, wraz z upowszechnieniem się bezprzewodowych słuchawek dousznych, sytuacja nieco się rozluźnia. AirPods sprawiły, że ludzie rozmawiający ze sobą, a wbudowany mikrofon rejestruje i transmituje wszystko, co mówią, stali się codziennością. Ale rozmowa z człowiekiem i rozmowa z komputerem to dwie zupełnie różne rzeczy.
Kiedy rozmawiasz z kimś, zazwyczaj czujesz ciepło, pokorę i, co najważniejsze, ludzką więź. Rozmawiając z przyjacielem przez telefon, nie czujesz się skrępowany. A jeśli dzwonisz w miejscu publicznym, rozmowa bez trzymania telefonu przy uchu staje się naturalną częścią naszego życia.
Ale kiedy rozmawiasz z komputerem, nie ma w tym żadnych emocji. Twój głos brzmi jak robot i używasz słów, których normalnie nie użyłbyś, rozmawiając z człowiekiem. To tylko seria instrukcji, ale dziś modele sztucznej inteligencji są na tyle inteligentne, że potrafią przekształcić te niespójne zdania w coś sensownego i przekazać je jako polecenia.
Wierzymy, że narzędzia, których ludzie używają do prowadzenia swoich firm, będą w coraz większym stopniu opierać się na komunikacji głosowej.
Jeden z założycieli, z którymi rozmawialiśmy, osiągnął już ten etap. Mówi, a nie pisze o prawie wszystkim, i reszta jego dnia kręci się wokół tego.
Bez jakich narzędzi nie możesz pracować? pic.twitter.com/bupBikudcL
— Willow (@WillowVoiceAI) 3 sierpnia 2026
Czuję się skrępowany za każdym razem, gdy zaczynam pisać artykuł lub wiadomość. „Dlaczego ten facet nagle mówi o tym, że model sztucznej inteligencji Anthropic wymknął się spod kontroli i włamał się do usług zewnętrznych?” „Dlaczego bredzi o tym, że Google naprawiło błąd Bluetooth w swoich telefonach Pixel ?” „Dlaczego ten facet mówi chaotycznie i chaotycznie o przestrzeganiu zasad projektowania interfejsu użytkownika Apple ?”
Wszystkie te sytuacje są częścią mojej codziennej pracy i nie wstydzę się tego, co robię. Uwielbiam to. Jednak za każdym razem, gdy korzystam z narracji głosowej w przestrzeni wspólnej, bibliotece czy pobliskiej kawiarni, martwię się, że osoba siedząca obok mnie może myśleć o mnie w ten sposób.
A może po prostu muszę zebrać w sobie trochę odwagi?
Tak, świat nie dba o mnie i nie wie, kim jestem. A obcy nie powinien się przejmować tym, co robię ze swoim komputerem. Ale normy społeczne i sposób działania ludzkiej świadomości sprawiają, że czuję się nieswojo za każdym razem, gdy zaczynam rozmawiać z komputerem.
Jest 12:42. Piszę ten artykuł za pomocą Willow Voice i wciąż martwię się, że sąsiad z góry albo sąsiad zza ściany usłyszy moje gadanie o dyktowaniu głosowym w środku nocy. Podoba mi się ta funkcja i to, że udało mi się napisać ten artykuł w mniej niż 15 minut.
Nadal czuję się nieswojo za każdym razem, gdy korzystam z tych niezwykle dokładnych i wydajnych narzędzi do dyktowania głosowego na moim komputerze. Obawiam się, że nie przyzwyczaję się do nich, dopóki cały świat nie będzie „uzależniony od głosu” w swojej pracy. Na razie będę prowadzić rozmowy komputerowe w wygodnych mieszkaniach z zamkniętymi oknami.
Możliwość dodawania komentarzy nie jest dostępna.