Für Unternehmen
Gemini 3.5 Transcribe ist beeindruckend. Für vertrauliche Gespräche ändert es nichts.
Am 26. August hat Google Gemini 3.5 Transcribe als öffentliche Preview vorgestellt, und die Schlagzeilen sind entsprechend: Das Diktiergerät sei tot, Tippen sowieso. Wer sich die Ankündigung ansieht, versteht die Begeisterung. Wer Gespräche führt, die niemanden außerhalb des Hauses etwas angehen, sollte trotzdem eine Frage stellen, die in den Schlagzeilen nicht vorkommt: Wo landet das, was ich sage?
Was Gemini 3.5 Transcribe kann
Die Zahlen sind gut. Google nennt eine Fehlerquote von 2,6 Prozent bei aufgezeichneten Dateien und 4,0 Prozent im Live-Streaming, über 85 Sprachen mit regionalen Akzenten und die Unterscheidung von bis zu drei Sprechern mit Zeitstempeln. Vor allem aber räumt das Modell auf: Füllwörter verschwinden, Selbstkorrekturen werden aufgelöst. Aus „Treffen wir uns Dienstag, äh nein, Mittwoch" wird der Satz, den man gemeint hat. Gesprochene Anweisungen wie „mach daraus eine Liste" kann es an andere Gemini-Modelle weiterreichen.
Erreichbar ist das Ganze über die Gemini API, Google AI Studio und die Enterprise-Plattform. Für Endnutzer kommt es zuerst in die Android-Tastatur Gboard (Funktion „Rambler", zunächst in ausgewählten Ländern) und in die Gemini-App für macOS. Diktieren wird damit zu einer Systemfunktion, die einfach da ist.
Das ist ein echter Fortschritt, und es wäre unehrlich, ihn kleinzureden. Eine Spracherkennung, die auf dem Gerät läuft, erreicht diese Werte heute nicht. Wer Texte diktiert, die ohnehin öffentlich sind, bekommt hier ein hervorragendes Werkzeug.
Was sich nicht ändert: Jedes Wort geht in die Cloud
Gemini 3.5 Transcribe ist ein Cloud-Modell. Die Aufnahme wird an Googles Server übertragen und dort verarbeitet, ob über die API oder über die Tastatur. Das ist keine Kritik an Google, sondern die Architektur: Ein Modell dieser Größe läuft nicht auf einem Telefon.
Für viele Anwendungen ist das in Ordnung. Für ein Mandantengespräch, eine Besprechung mit Kundendaten, ein Personalgespräch oder eine Schulung mit internen Abläufen ist es der entscheidende Punkt. Wer unter Schweigepflicht arbeitet oder Betriebsgeheimnisse bespricht, muss vor dem Einsatz dieselben Fragen beantworten wie bei jedem anderen Cloud-Dienst: Wo wird verarbeitet, gibt es einen Auftragsverarbeitungsvertrag, ist Training ausgeschlossen, wie lange liegen die Daten dort? Die Kriterien im Detail stehen in unserem Leitfaden zu KI-Meeting-Tools und DSGVO. Und selbst wenn alle Antworten passen: Die Aufnahme hat das Haus verlassen.
Diktat ist nicht Gespräch
Es gibt noch einen zweiten Unterschied, der in der Debatte untergeht. Gboard-Diktat ist aktives Sprechen ins Handy: Man nimmt es in die Hand, tippt ins Textfeld, spricht, kontrolliert. Das löst das Problem „Tippen ist langsam".
Das Problem in Besprechungen ist ein anderes. Dort redet nicht einer ins Gerät, sondern mehrere miteinander, und niemand hat die Hände frei. Menschen sind nicht dafür gebaut, zuzuhören, mitzudenken und gleichzeitig mitzuschreiben. Was hier hilft, ist ein Werkzeug, das nebenbei läuft und am Ende nicht eine Textwand liefert, sondern das Dokument, das man ohnehin gebraucht hätte: Entscheidungen, Aufgaben, Fristen, in der Struktur, die man selbst vorgibt.
Wo Voxvaria anders ansetzt
Voxvaria ist für genau diesen Fall gebaut. Die Spracherkennung läuft vollständig auf dem Gerät, die Aufnahme wird weder gespeichert noch übertragen. Aus dem erkannten Text entsteht ein strukturiertes Dokument nach der Vorlage, die du festlegst; dafür geht nur der Text, verschlüsselt, über unseren Server in Deutschland an Mistral AI in Frankreich, als Auftragsverarbeiter in der EU und ohne Nutzung für Training. Ein Konto gibt es nicht, einen Bot im Call auch nicht. Die Details stehen auf der Seite Warum Voxvaria.
Der Preis dafür ist ehrlich benannt: Die Erkennung auf dem Gerät ist nicht so gut wie ein Cloud-Modell von Googles Größe. Füllwörter bleiben eher stehen, exotische Fachbegriffe brauchen manchmal eine Korrektur. Für Gespräche, die das Haus nicht verlassen dürfen, ist das der Tausch, den man eingeht. Und weil aus dem Transkript ohnehin ein strukturiertes Dokument wird, fällt ein Füllwort im Rohtext am Ende weniger ins Gewicht als ein Satz, der in fremden Händen liegt.
Ist Gemini 3.5 Transcribe DSGVO-konform?
Das hängt wie bei jedem Cloud-Dienst vom Vertrag und vom Einsatz ab: Auftragsverarbeitungsvertrag, Datenstandort, Ausschluss von Training, Speicherdauer. Google bietet für Unternehmenskunden entsprechende Vereinbarungen an; die Prüfung liegt bei dir. Unabhängig davon verlässt die Aufnahme dein Gerät, und für Inhalte unter Schweigepflicht ist das oft der Grund, es nicht zu tun.
Läuft Gemini 3.5 Transcribe auf dem Gerät?
Nein. Das Modell läuft in Googles Cloud und wird über die Gemini API oder über Google-Produkte wie Gboard und die Gemini-App angesprochen. Ohne Internetverbindung funktioniert es nicht.
Ist On-device-Spracherkennung schlechter?
Bei der reinen Erkennungsqualität ja, das sollte niemand bestreiten. Der Unterschied zeigt sich vor allem bei Füllwörtern, Selbstkorrekturen und seltenen Fachbegriffen. Dafür bleibt die Aufnahme dort, wo sie entstanden ist. Welche Seite dieses Tauschs für dich zählt, entscheidet der Inhalt des Gesprächs.
Kann ich Voxvaria kostenlos ausprobieren?
Ja. Aufnahme und Transkription sind unbegrenzt kostenlos, die KI-Strukturierung ist mit 5 Dokumenten pro Monat frei. Ein Konto brauchst du nicht.
Voxvaria macht aus Gesprächen strukturierte Dokumente: Spracherkennung auf dem Gerät, kein Konto, Server in Deutschland. Kostenlos in Google Play, mit 5 Dokumenten pro Monat.
Voxvaria kennenlernen