Громкость и спектр у собеседников в одной комнате похожи - на этом
разделение по голосам и провалилось. Основная частота зависит от
говорящего, а не от его места за столом.
Замер на восьми записях: смешанные пары дают разрыв 68-93 Гц, однополые
11-33 Гц. Промежуточных случаев нет, поэтому порог в 40 Гц надёжен.
Признак работает на двух записях из восьми - там, где клиент мужчина,
а менеджер женщина.
В acoustics добавлено pitch_hz, в stats - pitch_separates с медианами
групп. Подсказку в промпт стоит давать только при pitch_separates=true:
в однополых парах разница в пределах шума и собьёт разметку.
Сравнение с эталоном уточнено: пометки расшифровщика вида *неразборчиво*
и латиница в названиях категорий больше не считаются ошибками.
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
На записях с микрофоном на столе голоса участников для модели почти
неразличимы: перебор четырёх моделей отпечатков и смена алгоритма
кластеризации баланс улучшают, но роли всё равно скачут.
Поэтому сервис теперь отдаёт то, на что можно опереться: акустику каждой
реплики (громкость, доля высоких, центроид - они связаны с расстоянием
до микрофона) и метрику separation_quality с флагом speakers_reliable.
Ниже 0.35 разметка по говорящим случайна, и роли должна определять LLM
по смыслу реплик.
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>