Commit Graph
2 Commits
Author SHA1 Message Date
Vladimir BryzgalovandClaude Opus 5 ba68785c81 Частота голоса как признак для разметки ролей
Громкость и спектр у собеседников в одной комнате похожи - на этом
разделение по голосам и провалилось. Основная частота зависит от
говорящего, а не от его места за столом.

Замер на восьми записях: смешанные пары дают разрыв 68-93 Гц, однополые
11-33 Гц. Промежуточных случаев нет, поэтому порог в 40 Гц надёжен.
Признак работает на двух записях из восьми - там, где клиент мужчина,
а менеджер женщина.

В acoustics добавлено pitch_hz, в stats - pitch_separates с медианами
групп. Подсказку в промпт стоит давать только при pitch_separates=true:
в однополых парах разница в пределах шума и собьёт разметку.

Сравнение с эталоном уточнено: пометки расшифровщика вида *неразборчиво*
и латиница в названиях категорий больше не считаются ошибками.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-17 23:03:32 +05:00
Vladimir BryzgalovandClaude Opus 5 e2db164f0b Признаки для расстановки ролей и оценка надёжности разделения
На записях с микрофоном на столе голоса участников для модели почти
неразличимы: перебор четырёх моделей отпечатков и смена алгоритма
кластеризации баланс улучшают, но роли всё равно скачут.

Поэтому сервис теперь отдаёт то, на что можно опереться: акустику каждой
реплики (громкость, доля высоких, центроид - они связаны с расстоянием
до микрофона) и метрику separation_quality с флагом speakers_reliable.
Ниже 0.35 разметка по говорящим случайна, и роли должна определять LLM
по смыслу реплик.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-15 23:21:56 +05:00