Разделы документации
Распознавание речиготовится
Планируемый контракт POST /v1/audio/transcriptions: обычный и потоковый режим, форматы text, json, srt
Запрос
Планируется обычная загрузка файла формой multipart/form-data. Авторизация — тем же заголовком Authorization: Bearer sk-libra-…, что и у текстовых методов.
| Поле | Тип | Обязательно | Описание |
|---|---|---|---|
| file | файл | да | Аудиозапись. Планируемые форматы: mp3, m4a, wav, ogg, webm, flac. Ограничение по размеру будет объявлено вместе с релизом. |
| model | строка | да | Модель распознавания. Планируемое имя — libra-stt. |
| language | строка | нет | Код языка по ISO 639-1, например ru или en. Если не указан, язык определяется автоматически. |
| response_format | строка | нет | Формат ответа: text, json или srt. По умолчанию json. |
| prompt | строка | нет | Подсказка со специальными терминами и именами — помогает распознать редкие слова. |
| temperature | число | нет | От 0 до 1. По умолчанию 0. |
Форматы ответа
Ответы планируется отдавать с Content-Type: application/json; charset=utf-8 для json и text/plain; charset=utf-8 для text и srt.
Потоковый режим
Для длинных записей и для расшифровки на лету планируется потоковая выдача: сервер присылает куски текста по мере распознавания, не дожидаясь конца файла. Механика та же, что у текстового стриминга в /v1/chat/completions — server-sent events, поток закрывается строкой data: [DONE].
- Обычный режим: вы загружаете файл целиком и получаете один ответ. Подходит для готовых записей.
- Потоковый режим: включается параметром stream=true, промежуточные куски приходят событиями. Подходит для диктовки и субтитров в реальном времени.
- В потоковом режиме формат srt не планируется — тайминги собираются на вашей стороне из полей каждого события.
Цены
Тарификация — по длительности аудио, а не по токенам. Считается фактическая длительность записи, а не время обработки.
| Режим | Цена |
|---|---|
| Обычное распознавание | 27 ₽ за час аудио |
| Потоковое распознавание | 54 ₽ за час аудио |
Баланс на аккаунте предоплаченный и сейчас ведётся только в токенах: списание происходит из поля usage ответа модели. Для почасовой тарификации распознавания нужен отдельный механизм списания — его ещё предстоит сделать, поэтому пересчёт минут аудио в списание с баланса пока не определён.