Пайплайн склеивал соседние отрезки речи и подавал склейку в модель одним
куском. На длинном куске GigaAM обрывается, не договорив, и терялся конец
фразы - до 15 % текста. Заметно на слух, но незаметно в счёте слов.
Теперь распознавание идёт по коротким отрезкам, а склеивается уже текст:
реплики остаются читаемыми, модель получает короткие куски. Turn хранит
список отрезков, из которых собран.
Замер на 205 минутах: слов +6,1 % к прошлой версии и +4,2 % к диаризации,
при этом обработка по-прежнему в 4,3 раза быстрее.
Запас по краям отрезка проверен и не подтвердился (разброс +-3 % без
направления) - настройка убрана, чтобы не оставлять мёртвый код.
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
Локальный FastAPI-сервис поверх GigaAM v3 и sherpa-onnx: приём аудио,
очередь задач, разделение по говорящим, постобработка терминов.
Доставка на Windows - ZIP со встроенным Python, без установки чего-либо.
Обновление кода при запуске тянется из релизов Gitea: меняется только
папка app, десятки килобайт вместо всего пакета.
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>