Własny fonemizator polskiego
Zamiast eSpeaka mam własny fonemizator. eSpeak myli między innymi przyimek „w”
przed spółgłoską dźwięczną: w „w drodze” brzmi on jak [v], w „w karczmie” jak [f],
a różnicy tej trzeba pilnować regułą, nie słownikiem wyjątków.
Model v4 jest trenowany na fonemach z mojego fonemizatora, nie na espeakowych.
Fonemizacja i trening mówią więc tym samym alfabetem.
VITS, potem ONNX
Trening VITS na własnym korpusie, eksport do ONNX, synteza bez połączenia z siecią.
Głos działa na procesorze: na laptopie, na telefonie i na Raspberry Pi.
Ten sam łańcuch w Kotlinie
Fonemizator odtworzyłem w Kotlinie w aplikacji na Androida, żeby model dostawał
na telefonie identyczne sekwencje co w treningu.
Jeden głos, trzy postacie
W grze tym samym głosem mówią karczmarz, kowal i zbrojny. Jeden model obsługuje
trzy postacie, bo osobne dopiero wytrenuję.