transcribe
Transcribe — официальный skill OpenAI для перевода аудио- и видеофайлов в текст. Его основной сценарий начинается с подготовки входных записей, после чего результат можно получить как обычный текст, JSON или diarized JSON с разделением реплик по говорящим. Источник также предусматривает language hint и известные образцы голосов, если нужно помочь разметить участников разговора. Skill рассчитан на повторяемый CLI-workflow: он предлагает использовать bundled transcribe_diarize.py, выбрать формат ответа, проверить качество транскрипции, корректность speaker labels и границы сегментов, а затем при необходимости сделать одну точечную итерацию. Перед запуском нужно собрать пути к одному или нескольким аудиофайлам, желаемый формат ответа, необязательную подсказку языка и известные ссылки на говорящих. Отдельное обязательное условие — проверить наличие OPENAI_API_KEY в окружении; исходник не предлагает передавать секрет через содержимое задачи. Для быстрого обычного текста используется модель gpt-4o-mini-transcribe с response-format text. Если требуется разметка говорящих или diarization, workflow переключается на gpt-4o-transcribe-diarize и diarized_json. Для записи длиннее примерно 30 секунд рекомендуется оставить chunking-strategy auto. Источник отдельно предупреждает, что prompting для diarize-модели не поддерживается. Практический запуск выполняется через Python CLI. Для одного файла результат можно сохранить параметром --out, например в transcript.txt. Для нескольких файлов предусмотрен --out-dir, чтобы результаты не перезаписывали друг друга; convention для evaluation runs — output/transcribe/<job-id>/. Отдельный пример показывает diarization с --known-speaker, где до четырёх известных участников связываются с эталонными аудиофайлами и результат сохраняется в отдельный каталог. Это не означает автоматическую проверку личности говорящего: образцы и их имена должны быть предоставлены в самом workflow, а после запуска всё равно требуется проверить speaker labels и сегменты. Ограничение skill практическое: без OPENAI_API_KEY live-транскрипция не стартует, а качество результата нельзя считать подтверждённым только по завершению CLI. После получения ответа нужно проверить полноту текста, границы сегментов и корректность меток, а изменение параметров делать только одной целевой итерацией. Для быстрого режима достаточно plain text, тогда как встречи и интервью с несколькими участниками требуют diarized_json и заранее известных speaker references. Сам skill описывает подготовку входа, выбор модели и формат сохранения; он не обещает исправить плохое качество исходной записи и не заменяет ручную проверку результата.
Для чего подходит
- Расшифровка аудио и видео
- Разделение реплик по говорящим
- Подготовка транскрипта с временными метками
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/openai/skills/tree/main/skills/.curated/transcribe