Pod koniec września dwa wydarzenia podgrzały dyskusję o interfejsach głosowych. Na konferencji Meta Connect Mark Zuckerberg pokazał Muse Charm, kieszonkowe urządzenie do rozmów z agentem AI Muse. Niedługo później OpenAI ruszyło z kampanią promującą ChatGPT Voice, funkcję asystenta, która pozwala rozmawiać z modelem i zlecać mu zadania samym głosem. Oba rozwiązania przesuwają ciężar interakcji z ekranu na dźwięk. Dla architektury Audio UX to zmiana paradygmatu: o wszystkim decyduje projekt akustyczny, czyli intonacja głosu asystenta, przestrzenne sygnały zwrotne (tzw. audio cues), a nawet higiena słuchowa otoczenia.
Projektowanie „pod ucho” przestaje być niszowym eksperymentem. Z wyzwaniami nawigacji bezwzrokowej od lat mierzą się twórcy aplikacji mobilnych, systemów przemysłowych czy usług transportowych, z których korzystamy na co dzień.
Niepełnosprawność sytuacyjna i efekt obniżonego krawężnika
Większość zespołów produktowych zakłada, że nawigacja głosowa czy sygnały dźwiękowe to kwestia dostępności przeznaczona dla określonej grupy. W projektowaniu produktów działa jednak tzw. efekt obniżonego krawężnika: rozwiązania tworzone z myślą o dostępności ostatecznie podnoszą wygodę wszystkich użytkowników.
Niepełnosprawność sytuacyjna (tzw. situational impairment) jest zjawiskiem powszechnym. Podczas jazdy samochodem, przenoszenia bagażu, biegu w deszczu czy pracy w hałaśliwym otoczeniu wzrok i uwaga są drastycznie ograniczone. W takich momentach to dźwięk musi przejąć rolę głównego nawigatora.
Ten język próbują opanować m.in. motoryzacja, logistyka, technologie asystujące i miejska infrastruktura. Z jakim skutkiem, zależy od rygoru projektowego i od tego, czy zespół rozumie, że sygnał dźwiękowy ma przede wszystkim prowadzić użytkownika, a nie tylko brzmieć.
Dźwięk, który podejmuje decyzje za kierowcę

Te same wyzwania mają globalne platformy mobilności miejskiej, które muszą precyzyjnie zarządzać uwagą użytkowników. W aplikacjach takich jak Freenow by Lyft dźwięk jest pełnoprawnym elementem interfejsu, a nie prostym powiadomieniem: towarzyszy pasażerom i kierowcom od pierwszego kliknięcia, przez koordynację odbioru, aż po bezpieczne zakończenie kursu. Jak wygląda to w praktyce, wyjaśnia Oliwier Migasiewicz, Head of Operations Freenow by Lyft:
„Cała ścieżka klienta we Freenow by Lyft jest zaprojektowana jako komplementarna całość na wskroś uzupełniających się kanałów, a dźwięk zdecydowanie jest jednym z nich. Rola sygnałuf audio jest szczególnie istotna tam, gdzie możliwości kontrolowania tego, co wizualnie dzieje się na ekranie telefonu są ograniczone lub użytkownik może być zajęty inna czynnością. Może to być przypomnienie o zabraniu swoich przedmiotów przy wysiadaniu z taksówki; informacja o kierowcy zbliżającym się do wskazanego przez nas punktu odbioru, czy w przypadku aplikacji kierowcy – zlecenie kolejnego przejazdu.”
Innym punktem odniesienia na polskim rynku jest Yanosik, aplikacja ostrzegająca o zdarzeniach drogowych, której użyteczność od lat opiera się na dźwięku. Informacja o radarze, kontroli czy wypadku dociera do kierowcy sygnałem akustycznym, więc nie musi on patrzeć na ekran, a wbudowany asystent głosowy pozwala zgłosić zdarzenie samą komendą, bez odrywania rąk od kierownicy.
W projektowaniu interfejsów kluczowe jest zmniejszenie obciążenia poznawczego (cognitive load). Zamiast analizować skomplikowany obraz na ekranie telefonu przy prędkości 120 km/h, kierowca dostaje natychmiastowy, jednoznaczny komunikat audio. Z drugiej strony należy pamiętać o tym, żeby dźwięk zaprojektować w umiejętny i przemyślany sposób. Wskazuje na to Artur Adamski, Head of Marketing w Yanosik S.A.:
„Z reakcji użytkowników nauczyliśmy się przede wszystkim tego, że “mniej zawsze znaczy więcej”, gdyż zalew komunikatów kończy się ich wyłączeniem. Czego brakuje w dzisiejszych nawigacjach i aplikacjach dla kierowców po stronie dźwięku? Z pewnością dźwięków dobrych, przemyślanych, łatwo identyfikowalnych i przygotowanych przez specjalistów. Byle beeper nigdy nie jest wystarczającym rozwiązaniem.”
Przy skali 3 milionów użytkowników miesięcznie przykład Yanosika pokazuje, jak systemy powiadomień audio wpływają na decyzje w czasie rzeczywistym. Dobrze zaprojektowany Audio UX pomada budować stałe nawyki, wysoką retencję i finalnie przekładać się na wyniki biznesowe.
Dźwięk, który daje niezależność
Na zaawansowany dźwięk przestrzenny (3D audio) stawia z kolei Microsoft Soundscape, aplikacja, która pomaga osobom niewidomym i słabowidzącym budować mentalną mapę otoczenia. Zamiast prowadzić użytkownika krok po kroku, opowiada mu o tym, co jest wokół: nazywa ulice, punkty orientacyjne, kierunek marszu. Każdy komunikat brzmi tak, jakby dochodził z odpowiedniej strony, z konkretnego miejsca w przestrzeni.
Według Światowej Unii Niewidomych na świecie żyje około 285 mln osób z dysfunkcją wzroku. W Polsce dane GUS wskazują na około 1,8 mln osób z ograniczeniami widzenia, z czego około 100 tys. to osoby całkowicie niewidome.
Gdy Microsoft zdecydował się zamknąć Soundscape, społeczność wolontariuszy ze Scottish Tech Army w cztery miesiące przejęła otwarty kod i stworzyła własną wersję, dowodząc, jak potężną lojalność buduje interfejs dźwiękowy, który rozwiązuje krytyczny problem.
Dźwięk, który daje wolność ruchu
Google Project Guideline, dziś rozwijany jako Running Guide, pozwala osobom niewidomym biegać samodzielnie: bez przewodnika, psa czy liny. System analizuje obraz z kamery i w czasie rzeczywistym zamienia go na sygnały dźwiękowe prowadzące biegacza: kiedy skręcić, kiedy zwolnić, gdzie czeka przeszkoda.
W 2022 roku sześciu niewidomych biegaczy w Japonii, wspierając się wyłącznie tą technologią, pokonało wirtualną sztafetę na dystansie 42,195 km w czasie 4 godzin 29 minut i 44 sekund. Twarzą projektu jest Thomas Panek, prezes organizacji Guiding Eyes for the Blind, który po latach biegania wyłącznie z przewodnikiem po raz pierwszy pokonał samodzielnie 5 km w Central Parku. Opisywał to jako poczucie wolności, jakiego nie miał od dekad.
Project Guideline to studium przypadku technologii, w której dźwięk zastępuje wzrok 1:1 i działa w warunkach krytycznych dla bezpieczeństwa: opóźnienie sygnału audio mogłoby skończyć się upadkiem.
Poza ekranem i drogą: logistyka, sport i eventy
Mechanizm łączący te trzy przykłady działa też poza motoryzacją i dostępnością. W magazynach logistycznych od lat działają systemy pick-by-voice, w których pracownik dostaje głosowe instrukcje, co i skąd wziąć, i przez cały czas ma wolne ręce. W magazynach chłodniczych to rozwiązanie ma dodatkowe praktyczne uzasadnienie: w niskiej temperaturze i w grubych rękawicach obsługa terminala dotykowego jest niewygodna, a czasem niemożliwa. Dźwięk jest tam jedynym efektywnym interfejsem. Dzięki temu rośnie wydajność operacyjna, a błędów w kompletacji zamówień jest znacznie mniej.
Tę samą logikę eyes-off widać w sporcie: zegarki i aplikacje treningowe podają tempo i dystans, a biegacz nie musi odrywać wzroku od trasy. Podobnie jest w grach i doświadczeniach VR/AR, a nawet w branży eventowej, na przykład w projekcie Sonic Gateway marki eBilet. Przy sprawdzaniu biletów w tłumie i w biegu, gdy obsługa nie patrzy na ekrany, dźwięk skanera musi bezbłędnie potwierdzić operację, łącząc użyteczność z doświadczeniem marki.
Branże i cele są różne, ale zasada jest ta sama: tam, gdzie wzrok zawodzi lub jest zajęty, dźwięk zostaje jedynym niezawodnym przewodnikiem.
Anatomia sukcesu
Różnica między systemem, który działa, a takim, który zawodzi, rzadko leży w samej technologii. Sprzęt i algorytmy są powszechnie dostępne, a trudność tkwi w mikro-decyzjach projektowych, które trzeba podjąć między wyborem technologii a jej wdrożeniem.
Projektowanie dla ucha rządzi się innymi zasadami niż projektowanie dla oka. Sygnał musi być jednoznaczny w ułamku sekundy, odporny na warunki akustyczne otoczenia i ułożony w hierarchię, która nie przeciąży pamięci roboczej użytkownika. Jak wygląda to w praktyce, podsumowuje Oliwier Migasiewicz (Freenow by Lyft):
„Słuchawki z redukcją szumów zmieniają zasady gry, bo użytkownik jest odcięty od otoczenia, a jednocześnie bardziej podatny na to, co słyszy w słuchawkach. Analogicznie, każdy środek transportu ma inną akustykę: spokój wnętrza auta, gwar postoju taksówek, szum wiatru na hulajnodze. Nie da się zaprojektować jednego dźwięku na wszystkie te sytuacje, ale da się stworzyć spójny język, w którym użytkownik rozpozna znaczenie sygnału niezależnie od tego, jaką formę transportu akurat wybrał.”
Od funkcji do emocji, czyli dźwięk jako punkt styku z marką
Dźwięk w produkcie rzadko ma tylko jedno zadanie. Oprócz użyteczności, jak ochrona uwagi kierowcy czy prowadzenie osoby niewidomej, warstwa audio jest narzędziem budowania relacji z marką. W środowiskach bez wzrokowych, gdzie nie ma tradycyjnych kreacji wizualnych, zamiana mechanicznego powiadomienia w doświadczenie marki to strategiczny bonus.
Zamiast traktować dźwięk wyłącznie jako komunikat potwierdzający wykonanie operacji, można przekuć go w unikalny punkt styku. Interfejs bezwzrokowy staje się wtedy także kanałem budowania zaangażowania i utrwalania tożsamości marki w pamięci odbiorcy.
Sonic Gateway marki eBilet dobrze pokazuje to przejście. W hałaśliwym tłumie przy wejściu na koncert czy mecz dźwięk skanera musi najpierw bezbłędnie potwierdzić operację, bez udziału wzroku. Dobrze zaprojektowany Audio UX zamienia potem ten przelotny mikromoment w melodię marki. Jak wyjaśnia Jan Kaliński, Head of Marketing eBilet Polska:
„W branży wydarzeń na żywo wszystko kręci się wokół emocji – od pierwszego kliknięcia przy zakupie biletu, po moment przekroczenia bramki. Często zapominamy jednak, że fizyczny punkt styku z marką to również mikromomenty, które klient zapamiętuje. Koncepcja Sonic Gateway zakłada ewolucję dźwięku skanera do pełnoprawnego punktu styku z marką. Taki przemyślany Audio UX nie tylko ułatwia interakcję na bramkach, ale realnie podnosi postrzeganą jakość usług i buduje zaufanie już u wejścia, udowadniając, że nowoczesny UX żyje także poza ekranem.”
Dźwięk to odpowiedzialność projektowa, nie dodatek
Marketing i zespoły produktowe wciąż zbyt często traktują dźwięk jako dodatek na końcu procesu: dżingiel w reklamie albo sygnał powiadomienia sprowadzony do ozdobnika. Tymczasem dźwięk bywa główną, a czasem jedyną drogą, którą produkt komunikuje się z użytkownikiem, gdy wzrok jest zajęty lub niedostępny.
Projektowanie interfejsów bezwzrokowych to praca z procesami poznawczymi użytkownika. Tak jak identyfikacja wizualna, wymaga rygorystycznej strategii i architektury informacji, z tą różnicą, że w świecie audio błąd irytuje, a przy tym może całkowicie odciąć użytkownika od produktu i zniszczyć zaufanie do marki. Dobrze zaprojektowany dźwięk daje też korzyść wizerunkową: zapamiętywalny punkt styku z marką.
Premiera Meta Muse i rozwój rozwiązań hands-free pokazują, że ekrany mogą stopniowo znikać z pierwszego planu. Zanim projekt trafi do kolejnego sprintu wdrożeniowego, warto zadać sobie pytanie: w których momentach nasz interfejs stanie się niewidzialny i czy dźwięk, który go zastępuje, jest gotowy na tę odpowiedzialność?