Podcaststudio ← Stemkloon

Twee tot vier referentiestemmen + een script → een gesprek. Eerst worden alle fragmenten van persoon 1 gemaakt, dan die van persoon 2 (enzovoort), en daarna wordt alles in scriptvolgorde gemonteerd.

1 Referentietracks

Upload per persoon een track met alleen die spreker. Kies een schoon stuk van 5–15 s (max. 30 s) en zorg dat het transcript daar precies bij past.

maximaal vier

2 Script

Eén beurt per regel met de naam van de persoon ervoor: Anna: …. Regels zonder naam horen bij de vorige beurt. (lacht), [muziek], *zucht* en regels met # worden niet uitgesproken.

Instellingen voor fijnafstelling

Kortere fragmenten zijn makkelijker los te verbeteren, langere klinken vaak natuurlijker. Pas na een wijziging hier het script opnieuw verwerken; fragmenten die gelijk blijven houden hun audio.

Alleen de parameters die de actieve engine (?) kent, staan hier. Lagere temperature = stabieler en vlakker, hogere = levendiger maar met meer kans op haperingen. guidance_scale: hoe strikt de tekst gevolgd wordt. num_steps (dots.tts): meer stappen = iets beter, trager. Batchgrootte > 1 maakt meerdere fragmenten per aanroep (alleen Qwen; sneller, experimenteel; bij een fout valt hij terug op 1).

3 Genereren en monteren

4 Fragmenten

klaar gewijzigd geen audio ⚙ = pauze, volume, seed, temperature per fragment

Verwerk eerst een script.