Cohere Transcribe (Local)
Marketplacevon TypeWhisper
Über
Cohere Transcribe (Local) ergänzt TypeWhisper um das offene Modell Cohere Transcribe 03-2026 als eigenständigen lokalen Anbieter. Es verwendet festgeschriebene GGUF-Modellgewichte über CrispASR, mit Metal-Beschleunigung auf Apple Silicon sowie CPU, NVIDIA CUDA oder AMD Vulkan unter Windows.
Modell und Laufzeit werden beim Einrichten des Add-ons heruntergeladen. Sobald die erforderlichen Dateien vorhanden sind, wird Audio auf deinem Computer transkribiert und nicht an die Cohere-Cloud-API gesendet. Dieses Add-on ist vom bestehenden Cohere-Cloud-Anbieter getrennt.
Releases und Anforderungen
| Plattform | Add-on-Version | Anforderungen | Release |
|---|---|---|---|
| macOS | 0.1.0 | TypeWhisper 1.5.0 oder neuer, macOS 14.0 oder neuer, Apple Silicon (arm64) | macOS-Release 0.1.0 |
| Windows | 1.0.1 | TypeWhisper 1.0.6 oder neuer, Windows x64 | Windows-Release 1.0.1 |
Modelle
Nur die ausgewählte Quantisierung wird geladen. Eine größere Datei bedeutet eine höhere numerische Präzision, aber die kontrollierten Benchmarks unten zeigen keine durchgehend bessere Genauigkeit bei steigender Quantisierungsgröße.
| Modell | ID | Download | Empfehlung |
|---|---|---|---|
| Kompakt (Q4_K) | cohere-transcribe-03-2026-q4_k | 1,51 GB | Kleinster Download und geringster Speicherbedarf. |
| Schnell (Q5_0) | cohere-transcribe-03-2026-q5_0 | 1,74 GB | Empfohlen. Bestes getestetes Verhältnis aus Größe, Geschwindigkeit und Genauigkeit. |
| Höhere Präzision (Q6_K) | cohere-transcribe-03-2026-q6_k | 1,98 GB | Mittlere numerische Präzision; bisher kein allgemeiner Genauigkeitsgewinn gemessen. |
| Maximale Präzision (Q8_0) | cohere-transcribe-03-2026-q8_0 | 2,42 GB | Experimentelle Vergleichsoption; bisher kein allgemeiner Genauigkeitsgewinn gemessen. |
Die macOS-Einstellungen setzen für Q4_K, Q5_0 und Q6_K einen Mac mit mindestens 8 GB voraus. Für Q8_0 wird ein Mac mit mindestens 16 GB empfohlen.
Funktionen und Datenschutz
- 14 unterstützte Sprachen: Englisch, Französisch, Deutsch, Spanisch, Italienisch, Portugiesisch, Niederländisch, Polnisch, Griechisch, Arabisch, Japanisch, Mandarin-Chinesisch, Vietnamesisch und Koreanisch
- Obligatorische Silero-Sprachaktivitätserkennung vor jeder Transkription, um Halluzinationen bei Stille und leisem Rauschen zu unterdrücken
- Batch-Transkription für Diktate und Dateitranskription
- Kein Cloud-API-Schlüssel erforderlich; ein optionales Hugging-Face-Token kann die Download-Limits erhöhen
- Kein Streaming, keine Übersetzung, Sprechertrennung oder Verstärkung von Wörterbuchbegriffen
- Modell-, Laufzeit- und VAD-Dateien sind festgeschrieben und werden per Prüfsumme verifiziert
- Cohere-Modellgewichte stehen unter Apache 2.0; CrispASR und das VAD-Modell unter der MIT-Lizenz
Plattformunterschiede
| Verhalten | macOS | Windows |
|---|---|---|
| Laufzeit | CrispASR mit Metal | CrispASR mit CPU, NVIDIA CUDA oder AMD Vulkan |
| Sprachauswahl | Eine unterstützte Sprache muss explizit ausgewählt werden | Verwendet einen expliziten Sprachhinweis, falls vorhanden; andernfalls lokale ECAPA-Spracherkennung |
| Backend-Auswahl | Metal auf Apple Silicon | Automatische lokale Backend-Auswahl mit Fallback oder ein ausgewähltes Backend |
| Modell-Lebenszyklus | Das ausgewählte Modell bleibt geladen und folgt der TypeWhisper-Richtlinie für lokale Modelle | Ein verwalteter lokaler Begleitprozess bleibt geladen und wird beim Entladen oder Beenden von TypeWhisper gestoppt |
Benchmarks
Dies sind kontrollierte FLEURS-Vergleiche und kein Versprechen, dass jedes Mikrofon, jeder Akzent oder jedes frei gesprochene Diktat dieselben Ergebnisse erzielt.
Richtungsweisender macOS-Quantisierungsvergleich
Dieser Lauf zur Produktauswahl verwendete einen Apple M1 Pro mit 16 GiB gemeinsamem Arbeitsspeicher, CrispASR 0.8.24 mit Metal und obligatorischer Silero-VAD sowie dieselben ersten fünf FLEURS-Clips für jeweils 13 Sprachen. Jede Quantisierung verarbeitete 65 Clips. WER war die primäre Metrik, außer für Japanisch, Mandarin-Chinesisch und Koreanisch, wo CER verwendet wurde.
| Quantisierung | Modellgröße | Laufzeit für 65 Clips | Peak RSS | Primärer Makrofehler |
|---|---|---|---|---|
| Q4_K | 1,51 GB | 50,77 s | 1,52 GiB | 7,99 % |
| Q5_0 | 1,74 GB | 44,00 s | 1,86 GiB | 7,60 % |
| Q6_K | 1,98 GB | 44,04 s | 1,97 GiB | 7,79 % |
| Q8_0 | 2,42 GB | 49,21 s | 2,37 GiB | 7,70 % |
Q5_0 bot in diesem kleinen Lauf das beste gemessene Gesamtverhältnis. Q4_K blieb eine glaubwürdige kompakte Option, während Q6_K und Q8_0 keinen allgemeinen Genauigkeitsvorteil zeigten. macOS-Issue #1031 enthält die Werte pro Sprache, Methodik, Startzeitmessungen und Einschränkungen.
Kontrollierter Windows-Quantisierungsbenchmark
Der Windows-Lauf verwendete einen AMD Ryzen 7 7800X3D, eine NVIDIA GeForce RTX 4060 Ti, 32 GB Systemspeicher und CrispASR 0.8.24 mit CUDA. Er verarbeitete dieselben 50 Clips in allen 14 Sprachen mit allen vier Varianten: insgesamt 2.800 Sprachtranskriptionen.
| Quantisierung | Non-CJK-Makro-WER | CJK-Makro-CER | Gewichtete RTFx | Startzeit | Peak Working Set |
|---|---|---|---|---|---|
| Q4_K | 7,67 % | 8,30 % | 32,27x | 3,39 s | 1,66 GiB |
| Q5_0 | 7,90 % | 8,29 % | 32,69x | 2,79 s | 1,87 GiB |
| Q6_K | 7,89 % | 8,27 % | 32,64x | 3,29 s | 2,10 GiB |
| Q8_0 | 7,93 % | 8,27 % | 31,78x | 3,80 s | 2,51 GiB |
Alle 2.800 Sprachclips wurden erfolgreich verarbeitet, und die obligatorische VAD lieferte bei allen 12 Prüfungen mit Stille und leisem Rauschen ein leeres Ergebnis. Das Peak Working Set misst Prozessspeicher, nicht GPU-VRAM. Windows-Issue #339 enthält Ergebnisse pro Sprache, exakte Revisionen, Reproduktionsschritte und Einschränkungen.
Früherer Cohere-vs-Parakeet-Vergleich
Ein früherer FLEURS-Vergleich über 13 Sprachen zeigte den Cohere-Kandidaten besonders stark für Deutsch, Spanisch, Polnisch, Japanisch, Mandarin-Chinesisch, Koreanisch, Vietnamesisch und Arabisch. Parakeet blieb deutlich schneller und kleiner und schnitt für Englisch und Italienisch besser ab.
Dieser Vergleich in macOS-Issue #1031 untersuchte den früheren Core-ML-Kandidaten. Er half dabei, Cohere als optionales, sprachspezifisches lokales Modell einzuordnen, seine Zahlen dürfen aber nicht als Messwerte des veröffentlichten GGUF-/CrispASR-Add-ons behandelt werden.
Einrichtung
- Öffne TypeWhisper Einstellungen > Integrationen > Entdecken.
- Installiere Cohere Transcribe (Local) und öffne die Einstellungen.
- Füge nur dann ein Hugging-Face-Token hinzu, wenn anonyme Downloads limitiert werden.
- Wähle eine Quantisierung. Beginne mit Schnell (Q5_0), sofern Downloadgröße oder Speicherbedarf nicht wichtiger sind.
- Lasse die Backend-Auswahl unter Windows auf automatisch oder wähle CPU, NVIDIA CUDA oder AMD Vulkan.
- Lade und aktiviere das ausgewählte Modell.
- Wähle Cohere Transcribe (Local) als Transkriptions-Engine in den Einstellungen oder in einem Profil.
- Wähle unter macOS vor der Transkription explizit eine der 14 unterstützten Sprachen aus.
Hinweise
- Das Add-on lädt Modell- und Laufzeitdateien separat herunter; sie sind nicht im Add-on-Bundle enthalten.
- Es wird immer nur eine Cohere-Quantisierung gleichzeitig geladen.
- Wörterbuchkorrekturen können nach der Transkription weiterhin angewendet werden, aber Cohere unterstützt keine Verstärkung von Wörterbuchbegriffen während der Inferenz.
- Verwende das bestehende Cohere-Add-on, wenn du ausdrücklich die Cohere-Cloud-Transcribe-API nutzen möchtest.