Blog
Głos lektora kontra AI. Granice prawne, klonowanie głosu i kary, o których firmy powinny wiedzieć
AI Act, deepfake audio, prawa lektorów i kary do 15 mln euro — co firma powinna wiedzieć, zanim opublikuje syntetyczny głos.
Jeszcze niedawno pytanie brzmiało: czy sztuczna inteligencja będzie potrafiła mówić jak człowiek? Dzisiaj brzmi inaczej: czy wolno jej mówić jak konkretny człowiek?
Technicznie granica praktycznie zniknęła. Dobre narzędzia do syntezy mowy potrafią wygenerować głos naturalny, poprawnie zaakcentowany i trudny do odróżnienia od nagrania wykonanego przez człowieka. Jeszcze większe możliwości daje klonowanie głosu. Kilka lub kilkanaście próbek może wystarczyć, aby stworzyć cyfrowy model przypominający konkretną osobę.
Dla producenta reklamy wygląda to kusząco. Bez studia, bez umawiania sesji, bez poprawek lektora. Zmieniamy dwa zdania i po kilku sekundach mamy nowy plik. Problem zaczyna się wtedy, gdy ktoś zada bardzo proste pytanie: czyj to właściwie jest głos i kto pozwolił nam go użyć?
Od 2 sierpnia 2026 roku odpowiedź na to pytanie ma w Unii Europejskiej jeszcze większe znaczenie. Obowiązują bowiem przepisy AI Act dotyczące przejrzystości materiałów generowanych przez sztuczną inteligencję.
Głos wygenerowany przez AI nie jest automatycznie nielegalny
Zacznijmy od ważnego rozróżnienia. Sam fakt wykorzystania syntetycznego głosu nie oznacza naruszenia prawa. Można legalnie korzystać z technologii text-to-speech, generować neutralne głosy czy pracować z modelami głosowymi, do których producent posiada odpowiednie prawa.
Sytuacja zmienia się, gdy wygenerowany głos zaczyna przypominać konkretną, istniejącą osobę. AI Act definiuje deepfake m.in. jako wygenerowaną lub zmanipulowaną przez AI treść audio, która przypomina istniejącą osobę i może zostać błędnie uznana przez odbiorcę za autentyczną. W takim przypadku podmiot wykorzystujący system powinien ujawnić, że materiał został sztucznie wygenerowany lub zmodyfikowany.
To istotne w reklamie. Wyobraźmy sobie spot, w którym nikt nie podaje nazwiska znanego lektora. Głos został jednak wygenerowany tak, żeby odbiorca pomyślał: „przecież to brzmi dokładnie jak on”. Brak nazwiska nie rozwiązuje problemu.
„Nie użyliśmy jego nagrania. Tylko zrobiliśmy podobny głos”
To jeden z najniebezpieczniejszych sposobów myślenia o voice AI. Prawo nie ogranicza się wyłącznie do pytania, czy skopiowano konkretny plik WAV.
W Polsce głos może podlegać ochronie jako element dóbr osobistych, szczególnie jeżeli jest na tyle charakterystyczny, że pozwala zidentyfikować konkretną osobę. Katalog dóbr osobistych z art. 23 Kodeksu cywilnego jest otwarty, a materiały prawnicze i doktryna od lat wskazują na ochronę rozpoznawalnego głosu – czasem określanego wręcz jako „dźwięczny wizerunek” człowieka.
Jeżeli doszło do naruszenia dobra osobistego, możliwe są m.in. roszczenia o zaprzestanie działania, usunięcie jego skutków oraz roszczenia pieniężne.
W praktyce pytanie nie powinno więc brzmieć: „czy ukradliśmy nagranie?”. Lepiej zapytać: „czy wykorzystujemy rozpoznawalną tożsamość głosową człowieka, który się na to nie zgodził?” To znacznie szerszy problem.
Lektor sprzedał nagranie. Czy sprzedał również swój głos do trenowania AI?
Nie. A przynajmniej nie należy tego zakładać. Jeżeli lektor nagrał spot radiowy, film korporacyjny czy serię komunikatów IVR, zakres wykorzystania powinien wynikać z umowy lub udzielonej licencji.
- Prawo do emisji reklamy przez rok nie oznacza automatycznie prawa do stworzenia cyfrowej repliki wykonawcy.
- Prawo do umieszczenia nagrania na stronie internetowej nie oznacza automatycznie prawa do wrzucenia pliku do systemu uczącego model głosowy.
- Prawo do montażu nagrania nie jest tym samym co prawo do wygenerowania pięciuset nowych zdań, których dana osoba nigdy nie wypowiedziała.
To szczególnie ważne w przypadku profesjonalnych lektorów. Ich praca może być również chroniona jako artystyczne wykonanie. Ustawa o prawie autorskim i prawach pokrewnych obejmuje ochroną m.in. działania aktorów i recytatorów oraz innych osób twórczo uczestniczących w wykonaniu utworu. Artyście wykonawcy przysługują określone prawa osobiste i majątkowe do wykonania.
Dlatego w profesjonalnej produkcji coraz ważniejsze stają się dwa oddzielne pytania: czy mamy prawo używać nagrania? oraz czy mamy prawo wykorzystywać głos do syntezy, trenowania lub stworzenia jego cyfrowego modelu? Odpowiedź na pierwsze pytanie nie daje automatycznie odpowiedzi na drugie.
Do 15 milionów euro. AI Act przestał być teorią
W przypadku części regulacji dotyczących sztucznej inteligencji mówimy już o obowiązującym prawie, a nie projekcie przyszłych przepisów. Od 2 sierpnia 2026 r. art. 50 AI Act nakłada obowiązki dotyczące m.in. oznaczania deepfake'ów. Jeżeli system AI tworzy albo manipuluje materiałem audio w taki sposób, że stanowi on deepfake, podmiot stosujący taki system powinien ujawnić, że materiał został sztucznie wygenerowany lub zmanipulowany.
I tutaj pojawia się liczba, która powinna zwrócić uwagę każdej agencji i działu marketingu. Naruszenie obowiązków z art. 50 znajduje się w kategorii, dla której AI Act przewiduje administracyjne kary sięgające 15 milionów euro lub 3% całkowitego światowego rocznego obrotu przedsiębiorstwa z poprzedniego roku obrotowego. W przypadku MŚP, w tym startupów, stosowany jest łagodniejszy mechanizm przewidziany w art. 99 ust. 6.
Nie oznacza to oczywiście, że każda źle oznaczona reklama dostanie karę 15 mln euro. To maksymalne poziomy sankcji, a wysokość kary zależy od okoliczności konkretnego naruszenia. Zmienia się jednak skala ryzyka. Pytanie „czy napiszemy gdzieś drobnym drukiem, że głos jest wygenerowany?” nie powinno być podejmowane pięć minut przed publikacją kampanii.
A RODO?
Tu również łatwo przesadzić w obie strony. Nie każde nagranie głosu jest automatycznie szczególną kategorią danych biometrycznych. Jeżeli jednak głos podlega specjalnemu przetwarzaniu w celu jednoznacznej identyfikacji konkretnej osoby – np. tworzony jest voiceprint pozwalający rozpoznać człowieka po głosie – wchodzimy w obszar danych biometrycznych. Europejska Rada Ochrony Danych opisuje właśnie taki przypadek przy systemach rozpoznawania użytkownika na podstawie modelu jego głosu.
Przy projektach związanych z klonowaniem głosu trzeba więc patrzeć szerzej niż tylko na prawo autorskie. Znaczenie mogą mieć jednocześnie:
- prawo do głosu i dobra osobiste,
- prawa artysty wykonawcy,
- postanowienia umowy z lektorem,
- AI Act,
- przepisy dotyczące danych osobowych,
- a czasem również odpowiedzialność za sposób wykorzystania wypowiedzi.
Jeden plik audio może dotykać kilku różnych obszarów prawnych jednocześnie.
Największym problemem AI bywa nie jakość. Jest nim pochodzenie nagrania
W produkcji reklamowej przyzwyczailiśmy się sprawdzać muzykę. Skąd pochodzi? Jaka jest licencja? Czy obejmuje internet? Czy obejmuje płatną kampanię? Na jaki czas? Na jakie terytorium? Z głosem powinniśmy robić dokładnie to samo.
Jeżeli agencja otrzymuje gotowy syntetyczny voice-over, samo zapewnienie dostawcy „mamy prawa” może być za mało. Dobrze wiedzieć:
- kto jest właścicielem lub licencjodawcą modelu,
- na jakiej podstawie powstał głos,
- czy przypomina konkretną osobę,
- czy osoba ta wyraziła zgodę na klonowanie,
- czy wykorzystanie komercyjne jest objęte licencją,
- czy głos może być używany w reklamie,
- czy istnieją ograniczenia dotyczące branży, terytorium lub okresu,
- czy materiał wymaga oznaczenia jako wygenerowany przez AI.
To trochę mniej wygodne niż kliknięcie „generate”. Ale znacznie wygodniejsze od tłumaczenia się po rozpoczęciu ogólnopolskiej kampanii.
Prawdziwy lektor również wymaga licencji. Różnica polega na tym, że wiadomo od kogo ją dostać
AI nie sprawił, że tradycyjne nagrania nagle stały się wolne od kwestii prawnych. Profesjonalne nagrania lektorskie również wymagają określenia sposobu wykorzystania. Inna będzie cena i zakres praw dla filmu wewnętrznego, inna dla reklamy emitowanej w radiu, a jeszcze inna dla ogólnopolskiej płatnej kampanii internetowej.
Różnica jest bardziej przyziemna. Przy prawdziwym lektorze istnieje konkretny człowiek, konkretne zlecenie, konkretna sesja oraz możliwy do udokumentowania zakres praw.
Dlatego profesjonalny bank głosów RPM Studio nie jest dziś tylko katalogiem przyjemnych barw głosu. Coraz ważniejsze staje się to, że za nagraniem stoi możliwe do ustalenia źródło, wykonawca i licencja.
W studiach RPM Studio w Warszawie, Wrocławiu i Tarnowie realizowane są zarówno klasyczne sesje lektorskie, jak i pełna postprodukcja audio. W przypadku produkcji zagranicznych nagrania mogą być realizowane z native speakerami w wielu językach.
To brzmi mniej futurystycznie niż „generatywny model mowy”. Ale kiedy za rok ktoś zapyta, skąd pochodzi głos wykorzystany w kampanii, odpowiedź „mamy podpisane prawa do tego nagrania” może być dużo więcej warta niż zaoszczędzone kilkaset złotych.
Czy można sprawdzić, czy ktoś sklonował konkretny głos?
Można analizować podobieństwo. Jeżeli pojawia się podejrzany materiał, nagranie można porównać z autentycznymi próbkami głosu danej osoby. Analiza może wskazać stopień zgodności cech głosowych, choć sama wysoka zgodność nie dowodzi jeszcze, że materiał został wygenerowany przez AI.
Naturalne nagranie tej samej osoby również powinno wykazywać wysokie podobieństwo. Dlatego analiza głosu jest narzędziem dowodowym i technicznym, ale nie magicznym wykrywaczem „AI / nie AI”.
RPM opisuje ten proces szerzej w materiale o weryfikacji podejrzanych nagrań i klonowaniu głosu oraz w artykule jak sprawdzić, czy nagranie wykorzystuje sklonowany głos.
AI zostanie. Zmienić musi się sposób zamawiania dźwięku
Sztuczna inteligencja nie zniknie z produkcji audio i nie ma powodu, żeby znikała. Będzie świetna w roboczych wersjach filmów, prototypach, automatycznych systemach komunikatów, tłumaczeniach, dostępności czy projektach, w których używany jest legalnie pozyskany syntetyczny głos.
Problem zaczyna się wtedy, gdy szybkość technologii wyprzedza pytanie o prawa. Dlatego przy wyborze między głosem AI a zawodowym lektorem cena samego pliku audio jest coraz mniej miarodajna. Trzeba doliczyć jeszcze jedną rzecz: pewność, że naprawdę wolno nam użyć głosu, który właśnie publikujemy.
I właśnie w tym miejscu klasyczne nagrania lektorskie, profesjonalne studio nagrań oraz sprawdzony bank głosów zaczynają mieć zupełnie nowe znaczenie. Nie dlatego, że sztuczna inteligencja jest zła. Dlatego, że dobry dźwięk powinien mieć nie tylko dobrą jakość. Powinien mieć także właściciela, historię i jasno określone prawa.
