Gateway
Справочник API

Audio Transcriptions

Распознавание речи

POST/v1/audio/transcriptions

Распознаёт речь из аудиофайла.

Когда использовать

  • расшифровка звонков;
  • заметки по встречам;
  • голосовые сообщения;
  • поиск по аудиоархиву.

Качество зависит от записи, шума, языка и модели.

Пример запроса

curl {{PUBLIC_API_BASE_URL}}/audio/transcriptions \
  -H "Authorization: Bearer gw_live_..." \
  -F model="provider/transcription-model" \
  -F file="@meeting.mp3" \
  -F language="ru"

Параметры тела запроса

ПолеОбязательностьОписание
modelДаПубличное имя модели распознавания.
fileДаАудиофайл.
languageНетЯзык аудио, если известен.
promptНетПодсказка с терминами или контекстом.
response_formatНетФормат ответа.
temperatureНетСвобода распознавания, если поддерживается.

Поля ответа

ПолеОбязательностьОписание
textДаРаспознанный текст.
durationНетДлительность аудио, если доступна.
languageНетОпределённый или переданный язык.
segmentsНетСегменты с таймкодами, если выбранный формат это поддерживает.

Пример ответа

{
  "text": "Добрый день. Обсудим запуск новой интеграции."
}