NeuroCall Speech API · Распознавание

Распознавание речи, рождённое в телефоне.

Модель, обученная на реальных звонках: телефонное качество звука, шум линии, переключения между казахским и русским внутри одной фразы. Ставится на ваши серверы и работает по API.

Документация
Страница «STT API»
kk + RU
Одна модель, код-свитчинг внутри фразы
8 кГц
Телефонный тракт — родная среда, не адаптация
on-prem
Аудио не покидает ваш периметр
01Возможности

Что именно продаёт STT-эндпоинт.

Телефонный звук без скидок на качество

Обучена на звонках, а не на студийных записях: шум линии, обрывы, перебивания, далёкий микрофон — среда, для которой модель и строилась.

Казахский и русский — как их говорят

Клиенты переключают язык посреди фразы. Код-свитчинг kk↔RU не ломает расшифровку и не требует выбирать один язык заранее.

Результаты по мере поступления звука

Стриминговый режим отдаёт частичные гипотезы во время речи; финальный текст приходит с таймкодами сегментов — готов для аналитики и записей.

Своя модель, своё дообучение

Никаких внешних API: веса стоят у вас. Под ваш домен — словарь терминов, названий и продуктов — модель дообучается командой, которая её писала.

02Интеграция

Один запрос — готовый результат.

  1. Шаг 1

    Аудио звонка

    Поток из SIP-транка или файл записи — WAV/PCM по HTTP или WebSocket.

  2. Шаг 2

    VAD нарезает речь

    Детектор активности голоса отделяет речь от тишины и гула линии.

  3. Шаг 3

    Модель распознаёт kk/RU

    Язык определяется на лету, переключения внутри сегмента учитываются.

  4. Шаг 4

    JSON с текстом и таймкодами

    Готово для CRM, карточки звонка и аналитики качества обслуживания.

Схема вызова · bash
curl -X POST https://neurocall.io/api/v1/transcriptions \
  -H "Authorization: Bearer $SPEECH_API_KEY" \
  -F "file=@call_220.wav" \
  -F "language=auto"          # kk | ru | auto

# → {
#     "text": "Сәлеметсіз бе! Менің картам бұғатталып қалды…",
#     "language": "kk",
#     "duration": 42.7,
#     "segments": [
#       { "start": 0.0, "end": 4.2, "text": "…" },
#       { "start": 4.2, "end": 9.8, "text": "…", "language": "ru" }
#     ]
#   }

Схема показывает форму интеграции: speech-тракт поставляется внутрь вашего периметра, базовый хост — ваш. Точный контракт фиксируем при подключении вместе с ключами.

Разворачивается там же, где весь агент.

Docker-образ в ваш контур: собственные веса модели, GPU-сервер, лимиты и тарифы чужого облака не применимы. Аудио и текст не покидают вашу сеть.

on-premisedockergpu
STT API · пилот

Проверим на ваших записях за первую неделю.

Пришлите выборку реального звука — вернём измеримый результат на ваших данных, а не демо на наших. Нужен и второй конец разговора? TTS API — тем же движком в том же контуре.