Zum Inhalt springen
23. September 2026 · Ausgabe 09/26 Immer aktuell
Digital & KI

KI-Transkription live im Meeting: Was Metas Tool wirklich kann

Meta hat ein Transkriptionsmodell veröffentlicht, das in Echtzeit mehr als 20 Sprecher und Sprachen gleichzeitig verarbeitet. Für kleine Teams mit internationalen Calls könnte das relevant sein.

KI-Transkription live im Meeting: Was Metas Tool wirklich kann
Symbolbild zur Meldung. Bild: KI-generiert

Meeting-Protokolle kosten Zeit. Wer Videocalls mit mehreren Teilnehmern und verschiedenen Sprachen transkribiert, kennt das Ergebnis: unlesbarer Brei, falsch zugeordnete Sprecher, fehlende Absätze. Meta hat am 2. September 2026 ein neues Modell veröffentlicht, das dieses Problem angeht. Der Name: Muse Voice Transcribe.

Was das Modell konkret leistet

Muse Voice Transcribe transkribiert Audioinhalte in Echtzeit. Zum Start unterstützt das Modell rund 25 Sprachen. Laut Meta sollen es später über 70 werden. Das Modell erkennt dabei mehr als 20 Sprecher gleichzeitig und ordnet deren Beiträge korrekt zu.

Zwei Funktionen sind besonders praxisrelevant. Erstens kommt das Modell mit Sprachwechseln mid-sentence zurecht. Wer also mitten im Satz vom Deutschen ins Englische wechselt, bringt das System nicht aus dem Takt. Zweitens ist das Modell darauf trainiert, bei komplexen Wörtern länger zu warten und bei einfachen schneller zu reagieren. Das soll die Genauigkeit verbessern.

Calls können laut Meta stundenlang laufen, ohne dass die Qualität nachlässt. Das ist für Teams relevant, die lange Projektmeetings oder Kundengespräche führen.

Verfügbarkeit und Kosten

Nur Mac, zunächst

Der Haken: Muse Voice Transcribe ist zum Start ausschließlich über die Meta-AI-App für macOS verfügbar. Die Mac-App kann Funktionen anderer Anwendungen aktivieren, was diese Integration erst ermöglicht. Wer Windows oder Linux nutzt, hat vorerst keinen direkten Zugang.

API-Zugang für Entwickler

Wer das Modell in eigene Produkte einbauen will, kann über Muse Code und Metas Model-API zugreifen. Der Preis liegt bei drei US-Dollar pro 1.000 Audiominuten. Für ein kleines Team mit wenigen Stunden Calls pro Woche bleibt das überschaubar. Wer regelmäßig mehrere Stunden täglich transkribiert, sollte vorher durchrechnen, was das im Monat kostet.

Eine Demoversion ist über den Meta-Blog zugänglich. Wer das Modell testen will, bevor er sich für die API-Nutzung entscheidet, kann das dort tun.

Der Wettbewerb

Meta ist nicht allein in diesem Segment. Ende August 2026 stellte Google mit Gemini 3.5 Transcribe ein Modell mit vergleichbaren Fähigkeiten vor. Google plant die Integration in Android und möglicherweise auch in Chrome. Das wäre eine deutlich breitere Verfügbarkeit als Metas aktueller Mac-only-Ansatz.

Konkrete Pläne, Muse Voice Transcribe in bestehende Meta-Produkte wie WhatsApp oder Workplace zu integrieren, gibt es laut aktuellem Stand nicht.

Was das für kleine Teams bedeutet

Transkriptionstools gibt es viele. Muse Voice Transcribe kombiniert Mehrsprachigkeit, Echtzeit-Verarbeitung und Sprechertrennung. Das ist für Teams relevant, die international arbeiten oder regelmäßig mit Kunden in verschiedenen Sprachen kommunizieren.

Wer bereits ein funktionierendes Transkriptionstool nutzt, muss nicht wechseln. Wer noch keines hat oder mit der Qualität unzufrieden ist, sollte die Demo testen. Der API-Preis ist für gelegentliche Nutzung moderat. Bei intensiver Nutzung lohnt ein direkter Kostenvergleich mit bestehenden Alternativen.

Fazit

Muse Voice Transcribe adressiert ein reales Problem in der Meetingdokumentation. Die Echtzeit-Transkription mit Sprechertrennung und Mehrsprachigkeit ist technisch sinnvoll. Die aktuelle Beschränkung auf macOS ist ein praktischer Nachteil. Für Entwickler mit konkretem Bedarf lohnt der Test über die API. Alle anderen warten besser ab, bis die Plattformverfügbarkeit breiter wird.

Ähnliche Beiträge