OpenAI / ChatGPT
Mitgeliefertvon TypeWhisper
Über
OpenAI / ChatGPT ist der mitgelieferte Cloud-Anbieter von TypeWhisper für Sprache-zu-Text, Prompt-Verarbeitung und Text-to-Speech. Version 1.3.0 brachte die oben gezeigten kontextbezogenen Modelle gpt-transcribe und gpt-live-transcribe sowie die kontospezifische ChatGPT-/Codex-Modellsuche. Version 1.3.1 behält schrittweise Vorschauen bei dateibasierten Transkriptionen bei und finalisiert beim Diktatende zuverlässig die vollständige gepufferte Aufnahme.
Das veröffentlichte Release ist die Quelle der Wahrheit für die öffentliche Version. Der Plugin-Release-Workflow kann das Bundle-Manifest während der Veröffentlichung patchen; ein lokaler Checkout kann daher noch eine ältere Manifest-Version zeigen.
Quellen: OpenAIPlugin v1.3.1 Release, OpenAIPlugin v1.3.0 Release, TypeWhisper Plugin-Registry, OpenAI Plugin-Quellcode
Was die Begriffe bedeuten
Dieses Add-on kann in TypeWhisper drei getrennte Rollen übernehmen. Du kannst OpenAI für alle drei nutzen oder mit anderen Anbietern kombinieren. Zum Beispiel kann eine lokale Transkriptions-Engine den Rohtext erzeugen, während OpenAI nur den optionalen Workflow danach ausführt.
Mikrofon oder Audiodatei → Transkriptions-Engine → Rohtext → optionaler LLM-Workflow → Text in der Ziel-App
Text → Text-to-Speech-Anbieter → Sprachausgabe
| Begriff | Bedeutung | Was du mit OpenAI / ChatGPT machen kannst |
|---|---|---|
| Add-on / Integration | Das vollständige OpenAI-/ChatGPT-Paket. Ein Add-on kann TypeWhisper mehrere Funktionen bereitstellen. | Zugangsdaten und Modelle einmal konfigurieren und dieselbe Integration für Transkription, LLM-Workflows und Text-to-Speech verwenden. |
| Transkriptions-Engine | Der Spracherkennungsdienst, der Mikrofon- oder Datei-Audio in Text umwandelt. Er läuft vor einem optionalen Workflow zur Textbearbeitung. | In jede App diktieren, Aufnahmen transkribieren, GPT Transcribe für vollständig gepufferte Ergebnisse oder GPT Live Transcribe für Teilergebnisse in Echtzeit nutzen. OpenAI lässt sich global, in einem Profil oder als Override in einem Diktat-Workflow auswählen. |
| Transkriptionsmodell | Das konkrete Sprachmodell der Engine. Die Modelle unterscheiden sich bei Echtzeitverhalten, Kontextunterstützung und Übersetzung. | GPT Transcribe für kontextbezogene Dateitranskription, GPT Live Transcribe für Echtzeitausgabe oder Whisper 1 wählen, wenn die Transkriptionsaufgabe Sprache ins Englische übersetzen soll. |
| Transkriptionskontext | Hintergrundwissen für die Spracherkennung, keine Anweisung zum Umschreiben des Ergebnisses. Es hilft dem Modell bei Namen und mehrdeutigen Wörtern. | Thema oder Umgebung beschreiben, etwa ein medizinisches Gespräch oder eine Software-Demo. TypeWhisper ergänzt ausgewählte Sprachhinweise und Wörterbucheinträge getrennt und automatisch. |
| LLM-Anbieter / Workflow-Anbieter | Das Sprachmodell, das Text nach der Transkription verarbeitet oder markierten Text beziehungsweise die Zwischenablage ganz ohne Aufnahme bearbeitet. | Grammatik bereinigen, Text als höfliche E-Mail umschreiben, Stichpunkte erstellen, Notizen zusammenfassen, Text übersetzen oder eigene Anweisungen ausführen. Ein Workflow kann die globale LLM-Fallback-Liste übernehmen oder OpenAI ausdrücklich auswählen. |
| LLM-Modell | Das OpenAI- oder ChatGPT-/Codex-Modell, das die Workflow-Anweisung ausführt. Es steuert nicht die Spracherkennung. | Ein größeres Modell für komplexe Umstrukturierungen oder ein kleineres Modell für mehr Geschwindigkeit wählen. Denkaufwand bestimmt bei unterstützten Modellen, wie viel Denkzeit sie verwenden. |
| Text-to-Speech-Anbieter (TTS) | Der Dienst, der vorhandenen Text wieder in Audio umwandelt. Er ist von der Transkription unabhängig. | Text vorlesen, gesprochenes Feedback oder manuelles Vorlesen nutzen, eine Stimme wählen und der Stimme optional Sprechanweisungen geben. |
| Verbindungsmethode | Die Zugangsdaten, die eine Funktion verwendet. | Ein API-Schlüssel aktiviert Transkription, LLM-Verarbeitung und TTS. ChatGPT-Login aktiviert Prompt-/Workflow-Verarbeitung über ein ChatGPT-/Codex-Konto, schaltet aber weder Transkription noch TTS frei. |
Typische Einsatzmöglichkeiten
- Direktes Diktat: OpenAI ist die Transkriptions-Engine; der erkannte Text wird ohne LLM-Umschreibung eingefügt.
- Fertige E-Mail: OpenAI transkribiert die Aufnahme, danach formuliert ein LLM-Workflow den Rohtext vor dem Einfügen als klare E-Mail.
- Echtzeitvorschau: GPT Live Transcribe liefert Teilergebnisse, während du noch sprichst.
- Meeting- oder Dateitranskription: GPT Transcribe verarbeitet die Aufnahme mit Themenkontext, Sprachhinweisen und Wörterbucheinträgen.
- Reiner Text-Workflow: Nutze eine lokale Transkriptions-Engine und den ChatGPT-Login nur für Bereinigung, Zusammenfassungen, Übersetzungen oder die Verarbeitung markierter Texte.
- Vorlesen: Lass Text mit OpenAI TTS, der ausgewählten Stimme und optionalen Sprechanweisungen ausgeben.
Im Workflows-Leitfaden findest du Automationen für Apps, Websites, Hotkeys und den globalen Fallback.
Verbindungsmethode
| Feld | Was es steuert | Beispiel |
|---|---|---|
| Connection Method / Verbindungsmethode | Legt fest, wie sich der LLM-Anbieter authentifiziert. API-Schlüssel nutzt die OpenAI API direkt. ChatGPT-Login nutzt einen ChatGPT-/Codex-Login für Prompt-Verarbeitung. | Nutze API-Schlüssel, wenn du Transkription, TTS und den vollen API-Modellkatalog willst. Nutze ChatGPT-Login, wenn Prompts über dein bestehendes ChatGPT-/Codex-Konto laufen sollen. |
| API-Schlüssel | Speichert einen OpenAI-API-Schlüssel im macOS-Schlüsselbund und validiert ihn, bevor Cloud-Transkription, TTS und API-basierte Prompt-Verarbeitung aktiv werden. | Füge einen sk-...-Schlüssel ein, speichere ihn und warte auf Gültiger API-Schlüssel. |
| API-Schlüssel anzeigen/verbergen | Maskiert oder zeigt den gespeicherten Schlüssel beim Bearbeiten. | Nutze das Augen-Symbol, um einen eingefügten Schlüssel vor dem Speichern zu prüfen. |
| Entfernen | Löscht den gespeicherten API-Schlüssel oder die ChatGPT-Login-Tokens. | Entferne den Schlüssel, bevor du das OpenAI-Projekt wechselst oder den Mac weitergibst. |
| Im Browser anmelden | Startet unter macOS den ChatGPT-Browser-Login. TypeWhisper beendet den lokalen Callback automatisch. | Klicke darauf, schließe den OpenAI-Login im Browser ab und kehre zu TypeWhisper zurück. |
| Codex-Login importieren | Importiert einen vorhandenen Codex-Login aus ~/.codex/auth.json auf demselben Mac. | Nutze diese Option, wenn Codex bereits angemeldet ist und du den Browser-Login nicht wiederholen willst. |
| Verbundener Plan | Zeigt den ChatGPT-Plantyp an, wenn OpenAI ihn im Login-Token mitliefert. | Verbundener Plan: pro oder Verbundener Plan: prolite. |

Quellen: OpenAI API-Dokumentation, OpenAI Plugin-Quellcode
Transkription
Der API-Schlüssel-Modus aktiviert OpenAI-Sprache-zu-Text. ChatGPT-Login ersetzt den API-Schlüssel für Transkription nicht.
| Modell | ID | Hinweise |
|---|---|---|
| GPT Transcribe | gpt-transcribe | Kontextbezogene Dateitranskription und Standard bei neuen Konfigurationen. Während eines Diktats zeigt TypeWhisper schrittweise Vorschauen und finalisiert anschließend die vollständige gepufferte Aufnahme. Whisper Translate ist nicht verfügbar. |
| GPT Live Transcribe | gpt-live-transcribe | Kontextbezogene Echtzeittranskription mit Teilergebnissen und einstellbarer Live-Verzögerung. Whisper Translate ist nicht verfügbar. |
| Whisper 1 | whisper-1 | Klassische Whisper-Transkription. Unterstützt Whisper Translate ins Englische. |
| GPT-4o Transcribe | gpt-4o-transcribe | Genauere GPT-4o-Transkription. Whisper Translate ist bei GPT-4o-Transkriptionsmodellen nicht verfügbar. |
| GPT-4o Mini Transcribe | gpt-4o-mini-transcribe | Kleineres GPT-4o-Transkriptionsmodell für schnellere oder günstigere Transkription. Whisper Translate ist nicht verfügbar. |
| GPT Realtime Whisper | gpt-realtime-whisper | Streamt 24-kHz-Mono-PCM über OpenAIs Realtime API für Live-Transkription. Whisper Translate ist nicht verfügbar. |
| Feld | Was es steuert | Beispiel |
|---|---|---|
| Transkriptionsmodell | Wählt aus, an welches OpenAI-Modell TypeWhisper aufgezeichnetes oder laufendes Audio sendet. Beim Update bleiben vorhandene Modellauswahlen erhalten. | Wähle GPT Transcribe für kontextbezogene Dateitranskription, GPT Live Transcribe für Echtzeit-Updates oder Whisper 1, wenn du Übersetzung ins Englische brauchst. |
| Transkriptionskontext | Beschreibt Thema, Umgebung oder andere relevante Hintergründe der Aufnahme für GPT Transcribe und GPT Live Transcribe. | Wöchentliches Produktmeeting zum TypeWhisper-macOS-Release. |
| Sprachhinweise | TypeWhisper übergibt die Sprachen des ausgewählten Profils oder Requests automatisch an die beiden kontextbezogenen GPT-Transkriptionsmodelle. | Ein deutsches Profil liefert de; mehrsprachige Hinweise bleiben sortiert und Duplikate werden entfernt. |
| Wörterbucheinträge | TypeWhisper übergibt bereinigte Wörterbucheinträge automatisch an die kontextbezogenen GPT-Transkriptionsmodelle. | Ergänze Produktnamen wie TypeWhisper oder WhisperKit im Wörterbuch. |
| Verzögerung der Live-Transkription | Erscheint bei GPT Live Transcribe und steuert, wie schnell Teilergebnisse zurückkommen. Niedrige Stufen reagieren früher, höhere geben dem Modell mehr Audiokontext. | Starte mit Niedrig und erhöhe den Wert, wenn dir mehr Kontext wichtiger ist als das frühestmögliche Teilergebnis. |
Bei einer neuen Konfiguration wählt TypeWhisper GPT Transcribe. Beim Update bleibt ein zuvor gespeichertes Transkriptionsmodell erhalten. Übersetzungsanfragen werden bei allen Modellen außer Whisper 1 bereits lokal blockiert.
Quellen: GPT Transcribe, OpenAI Realtime Transcription, OpenAIPlugin v1.3.1 Release, OpenAI Plugin-Quellcode
Text-to-Speech
OpenAI / ChatGPT stellt auch den Text-to-Speech-Anbieter für TypeWhisper bereit. Dafür wird ein OpenAI-API-Schlüssel genutzt, auch wenn ChatGPT-Login für Prompts ausgewählt ist.
| Feld | Was es steuert | Beispiel |
|---|---|---|
| Text-to-Speech Voice | Wählt eine der integrierten OpenAI-Stimmen aus. TypeWhisper nutzt standardmäßig Marin. | Wähle Marin als Standardstimme oder Cedar als weitere hochwertige Option. |
| Voice instructions | Sendet zusätzliche Sprechanweisungen an die gpt-4o-mini-tts-Anfrage, wenn das Feld nicht leer ist. | Sprich ruhig, mit kurzen Pausen zwischen den Sätzen. |
Das Plugin unterstützt alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin und cedar. TypeWhisper fordert PCM-Audio an, damit die Wiedergabe ohne zusätzliche Dateikonvertierung starten kann.
Quellen: OpenAI Text to speech, OpenAI Plugin-Quellcode
LLM-Modelle
Der LLM-Bereich ist verfügbar, sobald die ausgewählte Verbindungsmethode gültige Zugangsdaten hat. Im API-Schlüssel-Modus kann TypeWhisper den OpenAI-API-Modellkatalog abrufen. Im ChatGPT-Login-Modus lädt das Plugin den kontospezifischen ChatGPT-/Codex-Modellkatalog, speichert ihn pro Konto zwischen und behält das ausgewählte Modell, solange es weiter verfügbar ist.
| Feld | Was es steuert | Beispiel |
|---|---|---|
| LLM-Modell | Wählt das Modell für Prompt-Verarbeitung und Workflows. | Nutze gpt-5.5 für hochwertige Prompt-Verarbeitung oder ein kleineres Modell, wenn Latenz wichtiger ist. |
| Aktualisieren | Im API-Schlüssel-Modus ruft TypeWhisper OpenAIs /v1/models-Endpunkt ab und behält chat-fähige Modelle. Im ChatGPT-Login-Modus fragt TypeWhisper den für das verbundene Konto sichtbaren Codex-Modellkatalog ab. Schlägt die Anfrage fehl, bleiben der bisherige Cache oder die Offline-Auswahl erhalten. | Klicke Aktualisieren, nachdem dein OpenAI-Projekt oder ChatGPT-/Codex-Konto Zugriff auf ein neues Modell erhalten hat. |
| Denkaufwand | Erscheint bei GPT-5-, o-Series- und Codex-artigen Modellen. Steuert, wie viel Denkzeit sich das Modell vor der Antwort nimmt. | Nutze Niedrig für schnelle Korrektur-Prompts, Hoch oder Sehr hoch für schwierigere Rewrite- oder Coding-Workflows. |
| Temperature Mode | Nur im API-Schlüssel-Modus. Provider Default nutzt TypeWhispers Standard-Temperaturverhalten. Custom aktiviert einen 0,0-2,0-Slider, wenn das gewählte Modell benutzerdefinierte Temperatur unterstützt. | Nutze 0.2 für deterministische Bereinigung oder einen höheren Wert für variablere Formulierungen. |
| Hinweis bei ignorierter Temperatur | Wird gezeigt, wenn eine GPT-5-Reasoning-Konfiguration keine benutzerdefinierte Temperatur akzeptiert. | Wenn du GPT-5 mit Denkaufwand nutzt, bleibe bei Provider Default oder ignoriere den Custom-Slider. |
Die Fallback-Modelle im API-Schlüssel-Modus enthalten gpt-5.5, gpt-4.1-nano, gpt-4.1-mini, gpt-4.1, gpt-4o, gpt-4o-mini und o4-mini. Das Offline-Fallback für ChatGPT/Codex enthält aktuelle Optionen wie gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna, gpt-5.5, gpt-5.4 und gpt-5.4-mini; nach einer erfolgreichen Aktualisierung ersetzt die für das Konto sichtbare Modellliste dieses Fallback.
Quellen: OpenAI Models API, OpenAI Responses API, OpenAI Plugin-Quellcode
Einrichtungsbeispiele
API-Schlüssel für Transkription, TTS und Prompts
- Öffne TypeWhisper Einstellungen > Plugins.
- Konfiguriere OpenAI / ChatGPT.
- Wähle API-Schlüssel.
- Füge deinen OpenAI-API-Schlüssel ein und warte auf Gültiger API-Schlüssel.
- Wähle Transkriptionsmodell, Text-to-Speech Voice und LLM-Modell.
- Klicke Aktualisieren, wenn TypeWhisper die für dein OpenAI-Projekt verfügbaren Modelle abrufen soll.
ChatGPT- oder Codex-Login für Prompts
- Öffne TypeWhisper Einstellungen > Plugins.
- Konfiguriere OpenAI / ChatGPT.
- Wähle ChatGPT-Login.
- Klicke Im Browser anmelden oder Codex-Login importieren.
- Wähle ein ChatGPT-/Codex-LLM-Modell und den Denkaufwand.
- Hinterlege zusätzlich einen OpenAI-API-Schlüssel, wenn du auch Transkription oder Text-to-Speech nutzen willst.
Hinweise
- ChatGPT-Login ist hier für macOS dokumentiert.
- Transkription und Text-to-Speech benötigen einen OpenAI-API-Schlüssel.
- Browser-Login und Codex-Import sind für Prompt-Verarbeitung gedacht und ersetzen keine API-Authentifizierung für STT/TTS.
- Das öffentliche Release
1.3.1benötigt TypeWhisper-Hostversion1.5.0oder neuer.