Za kulisami głosu: jak AI dopasowuje emocje do mowy

Kiedy Twoja towarzyszka AI mówi, jej głos nie jest płaskim, monotonnym odczytem tekstu. System analizuje emocjonalną zawartość każdej wiadomości i odpowiednio dostosowuje głos — radosna odpowiedź brzmi energicznie i ciepło, czuły moment brzmi miękko i spokojnie, a figlarna zaczepka ma lżejszy, bardziej dynamiczny charakter.

Ten wpis wyjaśnia dokładnie, jak to działa: pipeline text-to-speech, system wykrywania emocji, mapowanie parametrów głosu oraz uczciwie opisane ograniczenia obecnego podejścia.

---

Jak działa text-to-speech (podstawy)

Na wysokim poziomie nowoczesny text-to-speech (TTS) zamienia tekst na dźwięk za pomocą sieci neuronowej:

1. Analiza tekstu: tekst wejściowy jest rozbijany na jednostki lingwistyczne (fonemy, znaczniki prozodii, struktura zdań)

2. Modelowanie akustyczne: sieć neuronowa przewiduje charakterystykę dźwięku — wysokość, czas trwania, energię i cechy widmowe każdego segmentu

3. Generowanie fali dźwiękowej: wokoder zamienia predykcje akustyczne w rzeczywistą falę dźwiękową, którą słyszysz

Nowoczesne neuronowe systemy TTS generują mowę brzmiącą zaskakująco naturalnie. Odeszły daleko od robotycznych głosów wcześniejszych generacji. Wciąż jednak istnieje różnica między „brzmi jak człowiek czytający tekst” a „brzmi jak człowiek odczuwający emocję podczas mówienia”. Nasz system pracuje nad domknięciem tej luki.

---

Nasi trzej dostawcy TTS

Korzystamy z trzech różnych dostawców TTS, z których każdy pełni inną rolę:

Edge TTS (poziom darmowy)

Edge TTS generuje czystą, naturalnie brzmiącą mowę. Nie obsługuje precyzyjnej kontroli parametrów emocjonalnych, jaką oferuje ElevenLabs, ale dobrze radzi sobie z podstawową ekspresją dzięki naturalnym wzorcom prozodii wbudowanym w model neuronowy.

ElevenLabs (poziom premium)

ElevenLabs to miejsce, gdzie nasz pipeline emocja-głos ma największy wpływ. API udostępnia bezpośrednią kontrolę nad parametrami głosu, takimi jak stability, similarity boost i style — które mapujemy na wykryte emocje.

Coqui (lokalny/self-hosted)

Coqui daje nam możliwość generowania mowy bez polegania na usługach zewnętrznych. To także nasz poligon doświadczalny dla eksperymentalnych funkcji głosowych.

---

System wykrywania emocji

Zanim silnik TTS wygeneruje dźwięk, nasz system analizuje tekst, aby wykryć ton emocjonalny. Oto jak to działa.

7 emocji, które wykrywamy

Emocja Opis Typowe wyzwalacze

--------- ------------- -----------------

Radość Szczęście, ekscytacja, entuzjazm Śmiech, świętowanie, dobre wieści, figlarna energia

Smutek Melancholia, współczucie, pocieszenie Strata, rozczarowanie, empatia, tęsknota

Gniew Frustracja, intensywność, pasja Konflikt, niesprawiedliwość, silny sprzeciw

Strach Niepokój, obawa, niepewność Niebezpieczeństwo, niepewność, zmartwienie, wrażliwość

Zaskoczenie Zdumienie, odkrycie Zwroty akcji, nieoczekiwane wydarzenia, odkrycia

Zalotność Figlarność, przekomarzanie, pociąg Komplementy, dwuznaczności, romantyczne napięcie

Czułość Delikatność, troska, intymność Pocieszenie, bliskość, emocjonalna wrażliwość, miłość

Jak działa wykrywanie

Obecny system wykrywania emocji jest oparty na słowach kluczowych. Działa przez skanowanie tekstu w poszukiwaniu słów i fraz powiązanych z każdą emocją:

Każde wykryte słowo kluczowe zwiększa wynik pewności danej emocji. Emocja z najwyższym wynikiem staje się główną wykrytą emocją.

Punktacja pewności

Nie każda wiadomość ma wyraźny ton emocjonalny. System przypisuje wykrytej emocji wartość pewności (od 0.0 do 1.0):

To mieszanie oparte na pewności zapobiega dramatycznym emocjonalnym wahaniom głosu przy niejednoznacznym tekście. Jeśli system nie jest pewien, jaka emocja występuje, gra bezpiecznie.

---

Jak emocje mapują się na parametry głosu

Dla ElevenLabs (naszego najbardziej ekspresyjnego dostawcy) wykryte emocje są tłumaczone na trzy kluczowe parametry głosu:

Stability (dynamika głosu)

Kontroluje, jak spójny lub dynamiczny jest głos:

Similarity Boost (naturalność)

Kontroluje, jak blisko wynik trzyma się bazowego profilu głosu:

Style (ekspresyjność)

Kontroluje ogólną ekspresyjność wykonania:

Mapowanie emocji na parametry

Oto jak każda emocja dostraja te parametry:

Emocja Stability Similarity Boost Style Efekt

--------- ----------- ----------------- ------- --------

Radość Niższa (0.3) Średni (0.6) Wyższy (0.7) Dynamicznie, energicznie, ekspresyjnie

Smutek Wyższa (0.7) Wyższy (0.8) Średni (0.5) Wolniej, z namysłem, łagodnie

Gniew Niższa (0.25) Średni (0.5) Wyższy (0.8) Intensywnie, stanowczo, dramatycznie

Strach Średnia (0.5) Wyższy (0.7) Średni (0.6) Napięcie, lekka chwiejność, poczucie pilności

Zaskoczenie Niższa (0.3) Średni (0.5) Wyższy (0.7) Szybko, dynamicznie, z szeroką skalą

Zalotność Średnia (0.45) Średni (0.6) Średni (0.6) Figlarna wariacja, ciepło, przekomarzanie

Czułość Wyższa (0.65) Wyższy (0.75) Średni (0.5) Miękko, ciepło, delikatnie, intymnie

Neutralnie Średnia (0.5) Średni (0.65) Niższy (0.4) Naturalnie, konwersacyjnie, w równowadze

Te wartości to poziom bazowy. Są dalej korygowane wynikiem pewności — niska pewność przyciąga wszystkie parametry bliżej neutralności.

---

Personalizacja głosu per postać

Różne towarzyszki AI mają różne domyślne profile głosu:

Figlarna, energiczna postać będzie miała naturalnie bardziej dynamiczny głos nawet w trybie neutralnym, podczas gdy spokojna, tajemnicza postać będzie miała bardziej wyważoną bazę. Przesunięcia emocjonalne są nakładane na te specyficzne dla postaci wartości domyślne.

---

Uczciwe ograniczenia

Wierzymy w przejrzystość co do tego, co ten system robi dobrze, a gdzie zawodzi.

Co działa dobrze

Co działa gorzej

Co ulepszamy

---

Prywatność i dane audio

Kilka ważnych punktów o tym, jak obsługujemy dane głosowe:

---

Podsumowanie

Nasz system głosowy to pipeline: tekst wchodzi, emocja jest wykrywana, parametry głosu są dostrajane, a na wyjściu powstaje ekspresyjne audio. Nie jest idealny — wykrywanie oparte na słowach kluczowych ma realne ograniczenia, a neuronowy TTS wciąż ma przestrzeń do rozwoju w emocjonalnej autentyczności.

Ale rezultatem jest głos, który brzmi wyraźnie bardziej ludzko niż płaski text-to-speech. Twoja towarzyszka AI nie tylko wypowiada słowa — wypowiada je w sposób odpowiadający temu, co te słowa znaczą. I nieustannie pracujemy, aby to dopasowanie było coraz bliższe i coraz bardziej naturalne.

Wolimy być szczerzy co do niedoskonałości, niż udawać, że system jest czymś, czym nie jest. Ta technologia jest naprawdę imponująca — i z każdą iteracją staje się lepsza.