Разбивка на предложения нужна LLM-разметке и была бы дублирована на стороне
Talkscore. Логика живёт рядом с ASR, который и ставит пунктуацию, а сам
вызов LLM остаётся на Talkscore: промпт меняется чаще, чем расшифровка,
и переразметить сохранённый текст дешевле, чем гонять аудио заново.
Документ интеграции дополнен итогами сравнения моделей, batch-ценами
и проверками формата ответа.
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
Прежняя оценка \$0,035 за час была расчётной и ошибочной в двадцать раз:
я считал выход по формату ответа, а обе модели оказались рассуждающими
и тратят на размышления тысячи токенов.
Замер: полные размышления \$0,75 за час, минимальные \$0,076, выключенные
\$0,055. Но при выключенных модель начинает менять роли местами в середине
разговора, поэтому рекомендованы минимальные.
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
Токен и расшифровки разговоров ходили по сети открытым текстом. Теперь в
пакете лежит Caddy: он держит сертификаты Let's Encrypt и продлевает их сам,
а сервис уходит на localhost.
Отдельно решён вопрос подмены адреса: за прокси все запросы приходят с
localhost, и список разрешённых адресов пускал бы кого угодно. Заголовку
с настоящим адресом сервис верит только от доверенного прокси - на это
восемь тестов.
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
205 минут разговоров: время по этапам, стоимость разметки ролей и качество
разделения говорящих. Главная цифра - разделение по голосам сработало на
одной записи из восьми, поэтому роли восстанавливает LLM.
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
Словарь замен расширен под нишу: категории прав, документы, госорганы,
термины обучения и оплаты, частые ошибки на плохом звуке.
В docs - инструкция для агента Talkscore: что выключить на своей стороне,
как ставить задачи и принимать вебхук, и главное - почему полю speaker
доверять нельзя и как восстанавливать роли через LLM.
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>