Zum Hauptinhalt springen

ScrAIbe: Research-Grade Transcription & Diarisation

ScrAIbe ist aus einem praktischen Bedarf in Forschungsprojekten entstanden: verlässliche Transkripte für Interviews, Besprechungen, Feldaufnahmen und technische Audiodaten, die generische Speech-to-Text-Dienste nur begrenzt abdecken. Ich habe es als Open-Source-Pipeline für Forschungsaufnahmen entwickelt, bei denen Rauschen, deutsch/englische Sprachwechsel und mehrere Sprecherinnen und Sprecher eher Normalfall als Ausnahme sind.

ScrAIbe ist eine modulare, mehrsprachige Pipeline für Transkription und Sprecherverarbeitung:

  • Whisper-basierte automatische Spracherkennung (ASR) für präzise Transkription und optionale segmentweise Übersetzung.
  • Sprecherdiarisierung und -erkennung via Pyannote, mit VoxCeleb-Embeddings für robuste Sprechertrennung.
  • Automatische Sprachidentifikation mit VoxLingua, um gemischtsprachige Aufnahmen sauber zu verarbeiten.
  • Mehrere Einstiegspunkte: eine Python-API für volle Kontrolle, eine CLI für Batch-Jobs und eine schlanke Gradio-App für schnelle lokale Läufe.

Mein Ziel mit ScrAIbe ist, hochwertige Transkription reproduzierbar, nachvollziehbar und an projektspezifische Anforderungen anpassbar zu machen. Für browserbasierte Team-Workflows stellt das Begleitprojekt ScrAIbe-WebUI eine eigene Weboberfläche auf Basis desselben Backends bereit.