Podcaststudio ← Stemkloon
Twee tot vier referentiestemmen + een script → een gesprek. Eerst worden alle fragmenten van persoon 1 gemaakt, dan die van persoon 2 (enzovoort), en daarna wordt alles in scriptvolgorde gemonteerd.
1 Referentietracks
Upload per persoon een track met alleen die spreker. Kies een schoon stuk van 5–15 s (max. 30 s) en zorg dat het transcript daar precies bij past.
2 Script
Eén beurt per regel met de naam van de persoon ervoor: Anna: …. Regels zonder naam horen bij de vorige beurt. (lacht), [muziek], *zucht* en regels met # worden niet uitgesproken.
Instellingen voor fijnafstelling
Kortere fragmenten zijn makkelijker los te verbeteren, langere klinken vaak natuurlijker. Pas na een wijziging hier het script opnieuw verwerken; fragmenten die gelijk blijven houden hun audio.
Alleen de parameters die de actieve engine (?) kent, staan hier. Lagere temperature = stabieler en vlakker, hogere = levendiger maar met meer kans op haperingen. guidance_scale: hoe strikt de tekst gevolgd wordt. num_steps (dots.tts): meer stappen = iets beter, trager. Batchgrootte > 1 maakt meerdere fragmenten per aanroep (alleen Qwen; sneller, experimenteel; bij een fout valt hij terug op 1).
3 Genereren en monteren
4 Fragmenten
Verwerk eerst een script.