Projektziele & Projektergebnis
eines Prototyps in den Bereichen „Produkte“ mit dem Ziel der Erhöhung/Steigerung/ Optimierung .
Das Projekt erprobte TTS-Modelle in Trainings- und Testläufen, dokumentierte Anforderungen an Infrastruktur und Workflows und schafft damit eine Entscheidungsgrundlage für die künftige TTS-Optimierung beim Unternehmen..
Gesamtprojekt
Top Erkenntnisse aus dem Projekt
Ausgangslage
Zentrale Fragestellungen im Projekt
- Wie kann ich mithilfe eigener Trainingsdaten ein TTS-Modell für personenindividuelle Sprachausgabe optimieren?
- Wie sinnvoll ist ein KI-Server für die Umsetzung, und ist dieser für ein KMU notwendig?
- Welche TTS-Ansätze – Piper, Coqui TTS, CosyVoice und Qwen3-gestützte Workflows – eignen sich für Qualität, Aufwand und Serverbetrieb am besten?
Projektdetails
Aicappella ist ein junges Unternehmen im Bereich KI-gestützter Sprach- und Audiotechnologie. Das Unternehmen entwickelt Ansätze für consent-basierte KI-Stimmen, bei denen eigene Trainingsdaten kontrolliert genutzt, Sprecher:innenrechte respektiert und nur freigegebene Audioergebnisse verwendet werden. Im Projekt wurde untersucht, wie sich mit eigenen Trainingsdaten ein Text-to-Speech-Modell (TTS-Modell) für personenindividuelle Sprachausgabe optimieren lässt und welche Serverinfrastruktur dafür notwendig ist. Dazu wurden prototypische Workflows für Datenvorbereitung, Training bzw. Modellanpassung, Inferenz und Qualitätsbewertung auf leistungsfähiger Recheninfrastruktur erprobt. Grund des Projekts war die Frage, ob Aicappella als kleines Unternehmen für die Optimierung und Bewertung von TTS-Modellen einen eigenen bzw. bereitgestellten KI-Server benötigt oder ob leichtere bzw. alternative Betriebsmodelle ausreichen.


.png-1024x765.webp)