Heute veröffentlichen wir AI Dictation v2 — eine Spracherkennungs-App, die auf dem plattformübergreifenden AI Suite v2-Stack basiert. Sprechen Sie und sehen Sie zu, wie die Worte erscheinen, zeichnen Sie ein Meeting auf, das Ihr Computer abspielt, oder fügen Sie eine Aufnahme ein – und erhalten Sie sauberen, bearbeitbaren Text. Das Ziel ist einfach: Gesprochenes in Text verwandeln, ohne Ihre Stimme in die Cloud zu senden.
Was es kann
AI Dictation transkribiert aus drei Quellen: Ihrem Mikrofon (diktieren Sie live und sehen Sie den Textstrom), der Audioausgabe Ihres Computers (ein Meeting, ein Video, ein Podcast, der auf Ihrem PC abgespielt wird), oder eine Audiodatei die Sie bereits haben. Mit der kostenlosen On-Device-Engine läuft die gesamte Transkription auf Ihrem Gerät — schalten Sie das Netzwerk aus, und es funktioniert weiterhin.
Beim ersten Aufnehmen wählt die App ein leistungsfähiges On-Device-Sprachmodell für Sie aus und lädt es herunter, dann untertitelt sie Ihre Sprache, während Sie sprechen. Wählen Sie die gesprochene Sprache oder lassen Sie sie automatisch erkennen, aktivieren Sie Zeitstempel, wenn Sie sie benötigen, und speichern Sie das Ergebnis als einfachen Text, als SubRip (.srt) oder WebVTT (.vtt) Untertitel, um ein Video zu untertiteln, oder als JSON mit den Zeitangaben jedes Segments für Ihre eigenen Werkzeuge.
Neu in Version 2
- Drei Erfassungsmöglichkeiten. Mikrofon, Systemaudio Ihres Computers oder eine Datei – Quellen mit einem Klick wechseln, mit einem Live-Meter, das anzeigt, dass Ihr Eingang erkannt wird.
- Wiedergeben und erneut transkribieren. Jede Aufnahme wird gespeichert, sodass Sie sie mit einem Wellenform-Scrubber abspielen und jedes Wort beim Abspielen hervorgehoben sehen können. Führen Sie eine Aufnahme jederzeit mit einem genaueren Modell erneut durch – das neue Ergebnis wird als separater Eintrag gespeichert, sodass das Original nie überschrieben wird.
- Untertitel und saubere Exporte. Exportieren Sie SubRip- und WebVTT-Untertitel mit präziser Zeitsteuerung, JSON für Ihre Werkzeuge oder reinen Text. Eine Bereinigungsfunktion bestimmt, wie Nicht-Sprachgeräusche wie [Musik] oder (Lachen) behandelt werden, mit der rohen Modellausgabe nur einen Klick entfernt.
- Verlauf, den Sie steuern. Jede Abschrift wird lokal gespeichert und im Ruhezustand verschlüsseltund kann jederzeit wieder geöffnet, kopiert oder fortgesetzt werden. Durchsuchen Sie jede Abschrift mit der Suchfunktion — die auch Ihre kürzliche Liste auf Aufnahmen filtert, in denen das eingegebene Wort vorkommt.
- Ihre Wahl der Engine. Starten Sie kostenlos mit einem Whisper-Modell auf dem Gerät. Pro schaltet größere Modelle, die OpenAI-Cloud-Engine und eine GPU-fähige lokale Engine für die anspruchsvollsten Audiodateien frei — mit integrierten GPU-Sicherheitsgrenzen und einer Option, Modelle geladen zu halten, damit Wiederholungsaufträge sofort starten.
- In 16 Sprachen. Die gesamte Benutzeroberfläche folgt der Sprache Ihres Betriebssystems, mit einem Ein-Klick-Wechsel in den Einstellungen, und sie transkribiert dutzende gesprochene Sprachen.
- Skriptfähig. Ein kopfloses Kommandozeilen-Tool transkribiert direkt vom Terminal und fungiert gleichzeitig als MCP-Server, sodass KI-Agenten und andere Werkzeuge es auf Ihrer eigenen Infrastruktur aufrufen können.
Alle Funktionen sind kostenlos
Wie bei der gesamten Suite ist keine Funktion hinter Pro gesperrt. Live-Diktat, System-Audio- und Datei-Transkription, Untertitel-Export, Wiedergabe, erneute Transkription, verschlüsselte Historie, Suchfunktion und das Kommandozeilen-Tool sind alle in der kostenlosen App enthalten, mit einem leistungsfähigen On-Device-Modell und ohne Zeitlimit oder nervige Hinweise. Pro bietet einfach die Wahl der Engine — größere lokale Modelle, die OpenAI-Cloud-Engine und eine GPU-beschleunigte lokale Engine, wenn Sie zusätzliche Genauigkeit wünschen. Sie verlieren niemals eine Funktion, wenn Sie die kostenlose Version nutzen.
Warum On-Device wichtig ist
Interviews, Meetings, medizinische Notizen, juristische Diktate – die Audioaufnahmen, die Menschen am meisten transkribiert haben möchten, sind oft solche, die nicht in die Cloud gelangen dürfen. AI Dictation bringt die KI stattdessen zu Ihren Aufnahmen: Mit der On-Device-Engine verlässt nichts das Gerät, Ihre Transkripte und Aufnahmen sind im Ruhezustand verschlüsselt, und es fallen keine Gebühren pro Minute für die Transkription an. Dasselbe On-Premises- und Datenschutz-zuerst-Prinzip steckt hinter allem, was Software Tailor entwickelt. [1].
Jetzt herunterladen
AI Dictation v2 ist jetzt im Microsoft Store für Windows als kostenloser Download verfügbar, mit Pro-Version, wenn Sie Premium- und Cloud-Engines wünschen. [2]. Editionen für macOS, Linux, Browser und Mobilgeräte sind in Planung. Lesen Sie die vollständige Funktionsübersicht auf der Produktseite.