ScrAIbe ist aus einem praktischen Bedarf in Forschungsprojekten entstanden: verlässliche Transkripte für Interviews, Besprechungen, Feldaufnahmen und technische Audiodaten, die generische Speech-to-Text-Dienste nur begrenzt abdecken. Ich habe es als Open-Source-Pipeline für Forschungsaufnahmen entwickelt, bei denen Rauschen, deutsch/englische Sprachwechsel und mehrere Sprecherinnen und Sprecher eher Normalfall als Ausnahme sind.
ScrAIbe ist eine modulare, mehrsprachige Pipeline für Transkription und Sprecherverarbeitung:
- Whisper-basierte automatische Spracherkennung (ASR) für präzise Transkription und optionale segmentweise Übersetzung.
- Sprecherdiarisierung und -erkennung via Pyannote, mit VoxCeleb-Embeddings für robuste Sprechertrennung.
- Automatische Sprachidentifikation mit VoxLingua, um gemischtsprachige Aufnahmen sauber zu verarbeiten.
- Mehrere Einstiegspunkte: eine Python-API für volle Kontrolle, eine CLI für Batch-Jobs und eine schlanke Gradio-App für schnelle lokale Läufe.
Mein Ziel mit ScrAIbe ist, hochwertige Transkription reproduzierbar, nachvollziehbar und an projektspezifische Anforderungen anpassbar zu machen. Für browserbasierte Team-Workflows stellt das Begleitprojekt ScrAIbe-WebUI eine eigene Weboberfläche auf Basis desselben Backends bereit.