Блог · 30 июня 2026

Расшифровка звонков в текст: способы, точность и 152-ФЗ

Звонки накапливаются быстро — а ценная информация из них оседает разве что в голове одного из участников. Расшифровка в текст решает эту проблему, но способы сильно отличаются по точности, скорости и юридическим рискам.

Зачем расшифровывать звонки

Аудиозапись — плохой инструмент для работы с информацией. Чтобы найти конкретный момент в часовом звонке, нужно перематывать запись. Чтобы поделиться договорённостью с коллегой, который не был на встрече, — пересказывать словами. Поиск по аудио невозможен.

Текстовая расшифровка меняет картину:

Особенно актуально это для команд, где большая часть коммуникации происходит через звонки: продажи, консалтинг, HR, управленческие совещания.

Способы расшифровки звонков

Ручная расшифровка

Классический подход: человек слушает запись и набирает текст. Точность при внимательной работе — высокая, но скорость катастрофически низкая. Один час аудио требует четырёх-шести часов ручной расшифровки. Для регулярных встреч это неприемлемо дорого — либо по деньгам (если нанимать расшифровщика), либо по времени (если делать самостоятельно).

ASR-сервисы (автоматическое распознавание речи)

ASR (Automatic Speech Recognition) — это программное распознавание речи. Современные модели обрабатывают час аудио за несколько минут и дают точность от 85 до 97% на чистой русской речи. Разброс объясняется условиями записи, качеством микрофонов и особенностями разговора.

ASR-сервисы бывают двух типов:

Облачные API

Аудио отправляется на серверы провайдера. Быстро, дёшево, но данные покидают ваш контур.

Self-hosted / on-prem

Модель работает на вашей инфраструктуре или в изолированном облаке. Данные никуда не уходят.

Именно здесь начинается важный вопрос для российского рынка: где физически обрабатывается аудио?

От чего зависит точность расшифровки

Качество записи

Самый весомый фактор. Шум в комнате, плохой микрофон, наложение голосов — всё это снижает точность даже самой продвинутой модели. Для регулярной работы стоит инвестировать в нормальные гарнитуры или направленные микрофоны. При видеоконференциях ситуацию улучшает режим шумоподавления в платформе.

Разделение спикеров (диаризация)

Базовое ASR выдаёт один сплошной текст без указания, кто что говорил. Диаризация — это отдельная задача: определить, сколько участников в записи, и разметить каждую реплику меткой спикера. Без диаризации транскрипт многоголосой встречи практически не читается.

Хорошая диаризация правильно разделяет реплики даже в условиях перекрёстных разговоров и похожих голосов. Пользователю остаётся лишь переименовать «Спикер A» в «Анна» — и всё остальное обновится автоматически.

Доменная лексика и словарь терминов

Общие модели распознавания обучены на широком корпусе текстов. Они хорошо справляются с разговорной речью, но могут ошибаться на профессиональной лексике: медицинских терминах, названиях продуктов, именах собственных, аббревиатурах. Сервисы, поддерживающие пользовательский словарь терминов, позволяют исправить это без переобучения модели.

Российская специфика и 152-ФЗ

Для компаний, работающих в России, расшифровка звонков — это не только вопрос удобства, но и вопрос соответствия законодательству.

Что такое персональные данные в контексте звонков

Запись деловой встречи содержит персональные данные участников: имена, голоса, должности, а нередко и данные третьих лиц (клиентов, кандидатов на вакансии). Федеральный закон № 152-ФЗ «О персональных данных» обязывает операторов обеспечивать обработку и хранение таких данных на серверах в Российской Федерации.

Риск иностранных сервисов

Многие популярные ASR-сервисы — иностранные: OpenAI Whisper API, Google Speech-to-Text, AWS Transcribe, Azure Cognitive Services. При использовании их API аудио передаётся на серверы за рубежом. Это означает трансграничную передачу персональных данных без надлежащего правового основания — потенциальное нарушение 152-ФЗ.

Последствия нарушений: административные штрафы, предписания Роскомнадзора и репутационные риски. Для компаний с государственными контрактами или работающих в регулируемых отраслях (здравоохранение, финансы, госсектор) риски особенно высоки.

Важно: даже если сам сервис декларирует соответствие GDPR или другим европейским стандартам, это не эквивалентно соответствию российскому 152-ФЗ в части локализации данных. Сервер должен физически находиться в РФ.

Как это устроено в Сказано.AI

Сказано.AI решает задачу расшифровки без компромиссов по безопасности данных.

Распознавание на своих серверах

Аудио не отправляется в иностранные API. Модели запущены на собственной инфраструктуре Сказано.AI в дата-центре в РФ.

Разделение спикеров

Диаризация работает «из коробки»: каждая реплика подписана и помечена таймкодом. Переименуйте спикеров один раз — остальное обновится само.

Словарь терминов

На тарифе Стандартный добавьте собственные термины, названия продуктов и имена — модель будет распознавать их точно.

Подробнее о технической стороне и мерах по защите данных — на странице Безопасность и 152-ФЗ. Возможности расшифровки и шаблоны отчётов описаны на странице Возможности.

Что получается на выходе

После расшифровки вы получаете полный транскрипт с метками времени и именами спикеров, доступный для поиска. Дополнительно AI формирует структурированный отчёт: краткое содержание, принятые решения, поручения с исполнителями. Можно задать уточняющие вопросы через чат — ответы придут со ссылками на конкретные реплики.

Экспорт — в PDF, DOCX, Markdown или JSON для интеграций. Поделиться отчётом можно по ссылке с защитой паролем.

Расшифровывайте звонки в России, по 152-ФЗ

180 минут бесплатно. Распознавание на собственных серверах в РФ — аудио никуда не уходит.