Microsoft baut seine KI-Infrastruktur im Audio-Bereich weiter aus. Die neue MAI-Modellfamilie (MAI steht für Microsofts proprietäre KI-Plattform) wird um drei spezialisierte Audio-Module erweitert, die gezielt für Voice-Agents und Sprach-Verarbeitung optimiert sind. Dies signalisiert Microsofts strategische Priorität auf Sprach-Interaktion als zentrales KI-Interface.

Das Modul MAI-Transcribe-2-Streaming ermöglicht Echtzeit-Transkription von Audioströmen. Das ist für Anwendungsszenarien wichtig, wo Audio in Echtzeit verarbeitet werden muss, etwa in Call-Centern, Live-Meeting-Transkriptionen oder virtuellen Assistenten. Die Streaming-Variante bedeutet, dass das System nicht auf vollständige Audioaufnahmen wartet, sondern Ergebnisse während des Sprechens liefern kann.

MAI-Voice-2.1 und MAI-Voice-2.1-Flash sind Text-to-Speech-Modelle, die gesprochene Wörter synthetisieren. Die Unterscheidung zwischen Standard und «Flash» deutet auf Performance-Varianten hin: Flash ist schneller, aber möglicherweise mit leicht reduzierter Qualität, während die Standardversion höhere Qualität bietet. Dies erlaubt es Entwicklern, je nach Anwendungsfall zwischen Geschwindigkeit und Qualität zu wählen.

Zusammen ermöglichen diese Module den Aufbau von sophistizierten Voice-Agents: Systeme, die Sprache verstehen, darauf reagieren und über Sprache kommunizieren, ohne menschliche Operatoren zu benötigen. Unternehmen können damit Kundenservice automatisieren, interne Diktier-Prozesse implementieren oder Accessibility-Features bereitstellen. Für KMU bedeutet dies neue Automatisierungspotentiale: Ein Callcenter kann mit Voice-Agents teilweise besetzt werden, Meetings können automatisch dokumentiert werden. Die Technologie wird über Microsofts Cloud-Plattform Azure verfügbar, was schnelle und skalierbare Implementierung erlaubt.