Zurück zu Add-ons
Cohere Transcribe (Local)

Cohere Transcribe (Local)

Marketplace

von TypeWhisper

Transkription macOSWindows
Cohere Transcribe (Local) Einstellungen

Über

Cohere Transcribe (Local) ergänzt TypeWhisper um das offene Modell Cohere Transcribe 03-2026 als eigenständigen lokalen Anbieter. Es verwendet festgeschriebene GGUF-Modellgewichte über CrispASR, mit Metal-Beschleunigung auf Apple Silicon sowie CPU, NVIDIA CUDA oder AMD Vulkan unter Windows.

Modell und Laufzeit werden beim Einrichten des Add-ons heruntergeladen. Sobald die erforderlichen Dateien vorhanden sind, wird Audio auf deinem Computer transkribiert und nicht an die Cohere-Cloud-API gesendet. Dieses Add-on ist vom bestehenden Cohere-Cloud-Anbieter getrennt.

Releases und Anforderungen

PlattformAdd-on-VersionAnforderungenRelease
macOS0.1.0TypeWhisper 1.5.0 oder neuer, macOS 14.0 oder neuer, Apple Silicon (arm64)macOS-Release 0.1.0
Windows1.0.1TypeWhisper 1.0.6 oder neuer, Windows x64Windows-Release 1.0.1

Modelle

Nur die ausgewählte Quantisierung wird geladen. Eine größere Datei bedeutet eine höhere numerische Präzision, aber die kontrollierten Benchmarks unten zeigen keine durchgehend bessere Genauigkeit bei steigender Quantisierungsgröße.

ModellIDDownloadEmpfehlung
Kompakt (Q4_K)cohere-transcribe-03-2026-q4_k1,51 GBKleinster Download und geringster Speicherbedarf.
Schnell (Q5_0)cohere-transcribe-03-2026-q5_01,74 GBEmpfohlen. Bestes getestetes Verhältnis aus Größe, Geschwindigkeit und Genauigkeit.
Höhere Präzision (Q6_K)cohere-transcribe-03-2026-q6_k1,98 GBMittlere numerische Präzision; bisher kein allgemeiner Genauigkeitsgewinn gemessen.
Maximale Präzision (Q8_0)cohere-transcribe-03-2026-q8_02,42 GBExperimentelle Vergleichsoption; bisher kein allgemeiner Genauigkeitsgewinn gemessen.

Die macOS-Einstellungen setzen für Q4_K, Q5_0 und Q6_K einen Mac mit mindestens 8 GB voraus. Für Q8_0 wird ein Mac mit mindestens 16 GB empfohlen.

Funktionen und Datenschutz

  • 14 unterstützte Sprachen: Englisch, Französisch, Deutsch, Spanisch, Italienisch, Portugiesisch, Niederländisch, Polnisch, Griechisch, Arabisch, Japanisch, Mandarin-Chinesisch, Vietnamesisch und Koreanisch
  • Obligatorische Silero-Sprachaktivitätserkennung vor jeder Transkription, um Halluzinationen bei Stille und leisem Rauschen zu unterdrücken
  • Batch-Transkription für Diktate und Dateitranskription
  • Kein Cloud-API-Schlüssel erforderlich; ein optionales Hugging-Face-Token kann die Download-Limits erhöhen
  • Kein Streaming, keine Übersetzung, Sprechertrennung oder Verstärkung von Wörterbuchbegriffen
  • Modell-, Laufzeit- und VAD-Dateien sind festgeschrieben und werden per Prüfsumme verifiziert
  • Cohere-Modellgewichte stehen unter Apache 2.0; CrispASR und das VAD-Modell unter der MIT-Lizenz

Plattformunterschiede

VerhaltenmacOSWindows
LaufzeitCrispASR mit MetalCrispASR mit CPU, NVIDIA CUDA oder AMD Vulkan
SprachauswahlEine unterstützte Sprache muss explizit ausgewählt werdenVerwendet einen expliziten Sprachhinweis, falls vorhanden; andernfalls lokale ECAPA-Spracherkennung
Backend-AuswahlMetal auf Apple SiliconAutomatische lokale Backend-Auswahl mit Fallback oder ein ausgewähltes Backend
Modell-LebenszyklusDas ausgewählte Modell bleibt geladen und folgt der TypeWhisper-Richtlinie für lokale ModelleEin verwalteter lokaler Begleitprozess bleibt geladen und wird beim Entladen oder Beenden von TypeWhisper gestoppt

Benchmarks

Dies sind kontrollierte FLEURS-Vergleiche und kein Versprechen, dass jedes Mikrofon, jeder Akzent oder jedes frei gesprochene Diktat dieselben Ergebnisse erzielt.

Richtungsweisender macOS-Quantisierungsvergleich

Dieser Lauf zur Produktauswahl verwendete einen Apple M1 Pro mit 16 GiB gemeinsamem Arbeitsspeicher, CrispASR 0.8.24 mit Metal und obligatorischer Silero-VAD sowie dieselben ersten fünf FLEURS-Clips für jeweils 13 Sprachen. Jede Quantisierung verarbeitete 65 Clips. WER war die primäre Metrik, außer für Japanisch, Mandarin-Chinesisch und Koreanisch, wo CER verwendet wurde.

QuantisierungModellgrößeLaufzeit für 65 ClipsPeak RSSPrimärer Makrofehler
Q4_K1,51 GB50,77 s1,52 GiB7,99 %
Q5_01,74 GB44,00 s1,86 GiB7,60 %
Q6_K1,98 GB44,04 s1,97 GiB7,79 %
Q8_02,42 GB49,21 s2,37 GiB7,70 %

Q5_0 bot in diesem kleinen Lauf das beste gemessene Gesamtverhältnis. Q4_K blieb eine glaubwürdige kompakte Option, während Q6_K und Q8_0 keinen allgemeinen Genauigkeitsvorteil zeigten. macOS-Issue #1031 enthält die Werte pro Sprache, Methodik, Startzeitmessungen und Einschränkungen.

Kontrollierter Windows-Quantisierungsbenchmark

Der Windows-Lauf verwendete einen AMD Ryzen 7 7800X3D, eine NVIDIA GeForce RTX 4060 Ti, 32 GB Systemspeicher und CrispASR 0.8.24 mit CUDA. Er verarbeitete dieselben 50 Clips in allen 14 Sprachen mit allen vier Varianten: insgesamt 2.800 Sprachtranskriptionen.

QuantisierungNon-CJK-Makro-WERCJK-Makro-CERGewichtete RTFxStartzeitPeak Working Set
Q4_K7,67 %8,30 %32,27x3,39 s1,66 GiB
Q5_07,90 %8,29 %32,69x2,79 s1,87 GiB
Q6_K7,89 %8,27 %32,64x3,29 s2,10 GiB
Q8_07,93 %8,27 %31,78x3,80 s2,51 GiB

Alle 2.800 Sprachclips wurden erfolgreich verarbeitet, und die obligatorische VAD lieferte bei allen 12 Prüfungen mit Stille und leisem Rauschen ein leeres Ergebnis. Das Peak Working Set misst Prozessspeicher, nicht GPU-VRAM. Windows-Issue #339 enthält Ergebnisse pro Sprache, exakte Revisionen, Reproduktionsschritte und Einschränkungen.

Früherer Cohere-vs-Parakeet-Vergleich

Ein früherer FLEURS-Vergleich über 13 Sprachen zeigte den Cohere-Kandidaten besonders stark für Deutsch, Spanisch, Polnisch, Japanisch, Mandarin-Chinesisch, Koreanisch, Vietnamesisch und Arabisch. Parakeet blieb deutlich schneller und kleiner und schnitt für Englisch und Italienisch besser ab.

Dieser Vergleich in macOS-Issue #1031 untersuchte den früheren Core-ML-Kandidaten. Er half dabei, Cohere als optionales, sprachspezifisches lokales Modell einzuordnen, seine Zahlen dürfen aber nicht als Messwerte des veröffentlichten GGUF-/CrispASR-Add-ons behandelt werden.

Einrichtung

  1. Öffne TypeWhisper Einstellungen > Integrationen > Entdecken.
  2. Installiere Cohere Transcribe (Local) und öffne die Einstellungen.
  3. Füge nur dann ein Hugging-Face-Token hinzu, wenn anonyme Downloads limitiert werden.
  4. Wähle eine Quantisierung. Beginne mit Schnell (Q5_0), sofern Downloadgröße oder Speicherbedarf nicht wichtiger sind.
  5. Lasse die Backend-Auswahl unter Windows auf automatisch oder wähle CPU, NVIDIA CUDA oder AMD Vulkan.
  6. Lade und aktiviere das ausgewählte Modell.
  7. Wähle Cohere Transcribe (Local) als Transkriptions-Engine in den Einstellungen oder in einem Profil.
  8. Wähle unter macOS vor der Transkription explizit eine der 14 unterstützten Sprachen aus.

Hinweise

  • Das Add-on lädt Modell- und Laufzeitdateien separat herunter; sie sind nicht im Add-on-Bundle enthalten.
  • Es wird immer nur eine Cohere-Quantisierung gleichzeitig geladen.
  • Wörterbuchkorrekturen können nach der Transkription weiterhin angewendet werden, aber Cohere unterstützt keine Verstärkung von Wörterbuchbegriffen während der Inferenz.
  • Verwende das bestehende Cohere-Add-on, wenn du ausdrücklich die Cohere-Cloud-Transcribe-API nutzen möchtest.