Perceptron: Perceptron Mk1.5Вход: ТекстВход: ИзображенияВход: ВидеоВход: Аудио→Выход: Текст25 сент. 2026 г.37K contextВводот17 ₽/MВыводот164 ₽/M
Google: Gemini 3.5 TranscribeВход: Аудио→Выход: Транскрипция25 сент. 2026 г.98K contextВвод (аудио)от220 ₽/MКэшот4 439 ₽/M
AssemblyAI: Universal-3.5 ProUniversal-3.5 Pro — это модель преобразования речи в текст от AssemblyAI, обслуживаемая через API синхронизации, возвращающая полную расшифровку с временными метками на уровне слов…Вход: Аудио→Выход: Транскрипция22 сент. 2026 г.Ввод (аудио)13 727 ₽/M
Xiaomi: MiMo-V2.6-Pro-UltraSpeedMiMo-V2.6-Pro-UltraSpeed — это высокоскоростная версия флагманской базовой модели Xiaomi MiMo-V2.6-Pro. Созданный на основе той же контрольной точки 1T MiMo-V2.6-Pro, он соответс…Вход: ТекстВход: ИзображенияВход: ВидеоВход: Аудио→Выход: Текст21 сент. 2026 г.1.0M contextВводот478 ₽/MВыводот956 ₽/MКэшот4,16 ₽/M
Xiaomi: MiMo-V2.6-FlashMiMo-V2.6-Flash — это базовая модель с открытым исходным кодом, разработанная Xiaomi. Построенный на архитектуре Mixture-of-Experts с общим числом параметров 309B и активацией 15B…Вход: ТекстВход: ИзображенияВход: ВидеоВход: Аудио→Выход: Текст21 сент. 2026 г.1.0M contextВводот12 ₽/MВыводот23 ₽/MКэшот0,23 ₽/M
Xiaomi: MiMo-V2.6-ProMiMo-V2.6-Pro — флагманская базовая модель, разработанная Xiaomi. Созданный в масштабе более 1Т параметров, он предназначен для того, чтобы расширить возможности самых ресурсоемких…Вход: ТекстВход: ИзображенияВход: ВидеоВход: Аудио→Выход: Текст21 сент. 2026 г.1.1M contextВводот24 ₽/MВыводот49 ₽/MКэшот2 ₽/M
Qwen: Qwen3.8 Omni FlashВход: ТекстВход: ИзображенияВход: АудиоВход: Видео→Выход: Текст21 сент. 2026 г.1M contextВводот0,76 ₽/MВыводот2,37 ₽/MКэшот0,08 ₽/M
Meta: Muse Voice Transcribe 1.0Muse Voice Transcribe 1.0 — это синхронная модель преобразования речи в текст от Meta. Он подходит для транскрипции в режиме «нажми и говори», конечной точки и транскрипции с учето…Вход: Аудио→Выход: Транскрипция11 сент. 2026 г.Ввод (аудио)5 491 ₽/M
Microsoft AI: MAI-Transcribe 2MAI-Transcribe 2 — это многоязычная модель преобразования речи в текст от Microsoft AI, занявшая первое место в многоязычном тесте FLEURS. Он поддерживает 60 языков с автоматическо…Вход: Аудио→Выход: Транскрипция3 сент. 2026 г.минутаот0,18 ₽/мин
Google: Gemini 3.8 Flash719.6KGemini 3.8 Flash — это самая интеллектуальная модель Flash от Google, которая значительно превосходит версию 3.7 Flash в разработке программного обеспечения, агентских задачах и мн…Вход: ТекстВход: ИзображенияВход: ВидеоВход: ФайлВход: Аудио→Выход: Текст2 сент. 2026 г.1.0M contextВводот3,78 ₽/MВыводот19 ₽/MКэшот0,38 ₽/Mтокены изображенияот41 ₽/Mкэш аудиоот4,12 ₽/Mвход аудиоот41 ₽/Mрассуждениеот206 ₽/Mвеб-поискот1,54 ₽
Google: Gemini 3.8 Flash (batch)Gemini 3.8 Flash — это самая интеллектуальная модель Flash от Google, которая значительно превосходит версию 3.7 Flash в разработке программного обеспечения, агентских задачах и мн…Вход: ТекстВход: ИзображенияВход: ВидеоВход: ФайлВход: Аудио→Выход: Текст2 сент. 2026 г.1.0M contextВводот42 ₽/MВыводот206 ₽/MКэшот4,16 ₽/M
HeyGen: Avatar IVHeyGen: Avatar IV — это модель преобразования изображения в видео, которая анимирует одну фотографию в выразительное видео с говорящей головой, синхронизированное по губам. Вместо…Вход: ТекстВход: ИзображенияВход: Аудио→Выход: Видео24 авг. 2026 г.секундаот5,49 ₽/с
NVIDIA: Nemotron 3.5 ASR Streaming Multilingual 0.6BNemotron 3.5 ASR Streaming Multilingual 0.6B — модель распознавания речи от NVIDIA. Его конструкция FastConformer-RNNT с подсказками и поддержкой кэша предназначена для транскрипци…Вход: Аудио→Выход: Транскрипция13 авг. 2026 г.Ввод (аудио)от365 ₽/M
Mistral: Voxtral Small 24B 2507 STTVoxtral Small 24B 2507 STT — модель транскрипции речи от Mistral AI. Он подходит для рабочих нагрузок транскрипции, перевода и понимания звука, которые выигрывают от большей емкост…Вход: Аудио→Выход: Транскрипция13 авг. 2026 г.Ввод (аудио)от5 491 ₽/M
Mistral: Voxtral Mini 3B 2507Voxtral Mini 3B 2507 — модель распознавания речи и звука от Mistral AI. Он подходит для транскрипции, перевода и компактной обработки звука.Вход: Аудио→Выход: Транскрипция13 авг. 2026 г.Ввод (аудио)от1 830 ₽/M
Google: Gemini 3.7 FlashGemini 3.7 Flash — это мультимодальная модель от Google для быстрых агентских рабочих процессов, кодирования и сложных многоэтапных рассуждений. Он предназначен для задач, требующи…Вход: ТекстВход: ИзображенияВход: ВидеоВход: ФайлВход: Аудио→Выход: Текст13 авг. 2026 г.1.0M contextВводот4,4 ₽/MВыводот22 ₽/MКэшот0,44 ₽/Mтокены изображенияот41 ₽/Mкэш аудиоот4,12 ₽/Mвход аудиоот41 ₽/Mрассуждениеот206 ₽/Mвеб-поискот1,54 ₽
Google: Gemini 3.7 Flash (batch)Gemini 3.7 Flash — это мультимодальная модель от Google для быстрых агентских рабочих процессов, кодирования и сложных многоэтапных рассуждений. Он предназначен для задач, требующи…Вход: ТекстВход: ИзображенияВход: ВидеоВход: ФайлВход: Аудио→Выход: Текст13 авг. 2026 г.1.0M contextВводот42 ₽/MВыводот206 ₽/MКэшот4,16 ₽/M
Qwen: Qwen3 ASR 1.7BQwen3 ASR 1.7B — модель автоматического распознавания речи от Qwen. Он поддерживает многоязычную идентификацию и транскрипцию на 30 языках и 22 китайских диалектах, с потоковой пер…Вход: Аудио→Выход: Транскрипция13 авг. 2026 г.Ввод (аудио)от823 ₽/M
Qwen: Qwen3 ASR 0.6BQwen3 ASR 0.6B — компактная модель автоматического распознавания речи от Qwen. Он поддерживает многоязычную идентификацию и транскрипцию на 30 языках и 22 китайских диалектах, с по…Вход: Аудио→Выход: Транскрипция13 авг. 2026 г.Ввод (аудио)от365 ₽/M
ByteDance: Seedance 2.0 MiniSeedance 2.0 Mini — модель генерации видео от ByteDance. Он поддерживает преобразование текста в видео, изображение в видео с контролем первого и последнего кадра, а также мультимо…Вход: ТекстВход: ИзображенияВход: ВидеоВход: Аудио→Выход: Видео12 авг. 2026 г.секундаот7,99 ₽/с
ByteDance: Seedance 2.5Seedance 2.5 — это модель генерации видео от ByteDance. Он подходит для подробного повествования, создания мультимодальных ссылок, редактирования видео и расширения видео. Он подде…Вход: ТекстВход: ИзображенияВход: ВидеоВход: Аудио→Выход: Видео7 авг. 2026 г.секундаот21 ₽/с
OpenAI: GPT TranscribeGPT Transcribe — это высокоточная модель преобразования речи в текст от OpenAI. Он подходит для записи аудио, потоковой транскрипции файлов и совершенных поворотов в реальном време…Вход: Аудио→Выход: Транскрипция5 авг. 2026 г.Ввод (аудио)от8 236 ₽/M
Thinking Machines: Inkling SmallInkling Small — это открытая мультимодальная смешанная модель экспертов от Thinking Machines Lab с 12B активных параметров из 276B. Он позиционируется как меньший по размеру и боле…Вход: ТекстВход: ИзображенияВход: Аудио→Выход: Текст30 июл. 2026 г.524K contextВводот49 ₽/MВыводот132 ₽/MКэшот11 ₽/M
Thinking Machines: Inkling Small (batch)Inkling Small — открытая мультимодальная MoE-модель Thinking Machines Lab с 12B активными параметрами из 276B общих. Меньший и более эффективный член семейства Inkling; подходит дл…Вход: ТекстВход: ИзображенияВход: Аудио→Выход: Текст30 июл. 2026 г.524K contextВвод66 ₽/MВывод159 ₽/M
MiniMax: H3MiniMax H3 — это легкая модель генерации видео с открытым весом от MiniMax. Он предназначен для точного мультимодального редактирования и контролируемой генерации контента, включая…Вход: ТекстВход: ИзображенияВход: ВидеоВход: Аудио→Выход: Видео29 июл. 2026 г.секундаот6,66 ₽/с
Fish Audio: Transcribe 1Transcribe 1 — это модель преобразования речи в текст от Fish Audio. Он подходит для транскрипции аудио с автоматическим определением языка и может возвращать сегменты уровня слова…Вход: Аудио→Выход: Транскрипция29 июл. 2026 г.Ввод (аудио)10 981 ₽/M
SpaceXAI: Grok STT 1.0Grok STT — это модель преобразования речи в текст SpaceXAI, доступная через конечную точку REST /v1/stt. Он поддерживает транскрипцию с временными метками на уровне слов, дополните…Вход: Аудио→Выход: Транскрипция23 июл. 2026 г.Ввод (аудио)от3 051 ₽/M
Google: Gemini 3.6 FlashGemini 3.6 Flash — это высокоэффективная модель от Google для кодирования, агентных рабочих процессов, а также разработки веб-сайтов и приложений. Он предназначен для получения без…Вход: ТекстВход: ИзображенияВход: ВидеоВход: ФайлВход: Аудио→Выход: Текст21 июл. 2026 г.1.0M contextВводот42 ₽/MВыводот206 ₽/MКэшот4,16 ₽/Mтокены изображенияот41 ₽/Mкэш аудиоот4,12 ₽/Mвход аудиоот41 ₽/Mрассуждениеот206 ₽/Mвеб-поискот1,54 ₽
Google: Gemini 3.6 Flash (batch)Gemini 3.6 Flash — это высокоэффективная модель от Google для кодирования, агентных рабочих процессов, а также разработки веб-сайтов и приложений. Он предназначен для получения без…Вход: ТекстВход: ИзображенияВход: ВидеоВход: ФайлВход: Аудио→Выход: Текст21 июл. 2026 г.1.0M contextВводот42 ₽/MВыводот206 ₽/MКэшот4,16 ₽/M
Google: Gemini 3.5 Flash LiteGemini 3.5 Flash Lite — высокопроизводительная модель от Google с расширенными агентскими возможностями. Он подходит для субагентов, выполняющих целенаправленные задачи в рамках сл…Вход: ТекстВход: ИзображенияВход: ВидеоВход: ФайлВход: Аудио→Выход: Текст21 июл. 2026 г.1.0M contextВводот17 ₽/MВыводот137 ₽/MКэшот2,08 ₽/Mтокены изображенияот16 ₽/Mкэш аудиоот1,65 ₽/Mвход аудиоот16 ₽/Mрассуждениеот137 ₽/Mвеб-поискот1,54 ₽
Google: Gemini 3.5 Flash Lite (batch)Gemini 3.5 Flash Lite — высокопроизводительная модель от Google с расширенными агентскими возможностями. Он подходит для субагентов, выполняющих целенаправленные задачи в рамках сл…Вход: ТекстВход: ИзображенияВход: ВидеоВход: ФайлВход: Аудио→Выход: Текст21 июл. 2026 г.1.0M contextВводот17 ₽/MВыводот137 ₽/MКэшот2,08 ₽/M
Thinking Machines: InklingInkling — это открытая мультимодальная смешанная модель экспертов от Thinking Machines Lab с 41 млрд активных параметров из 975 млрд. Он предназначен для рассуждений общего назначе…Вход: ТекстВход: ИзображенияВход: Аудио→Выход: Текст17 июл. 2026 г.524K contextВводот104 ₽/MВыводот444 ₽/MКэшот18 ₽/M
Thinking Machines: Inkling (batch)Inkling — это открытая мультимодальная смешанная модель экспертов от Thinking Machines Lab с 41 млрд активных параметров из 975 млрд. Он предназначен для рассуждений общего назначе…Вход: ТекстВход: ИзображенияВход: Аудио→Выход: Текст17 июл. 2026 г.524K contextВвод148 ₽/MВывод600 ₽/MКэш25 ₽/M
Deepgram: Nova-3Универсальная модель преобразования речи в текст Deepgram Nova-3 с поддержкой одноязычной и многоязычной транскрипции.Вход: Аудио→Выход: Транскрипция15 июл. 2026 г.Ввод (аудио)от7 870 ₽/M
Microsoft AI: MAI-Transcribe 1.5MAI-Transcribe 1.5 — это многоязычная модель преобразования речи в текст от Microsoft AI. Он подходит для субтитров, транскрипции вызовов, субтитров, специальных возможностей и дру…Вход: Аудио→Выход: Транскрипция2 июн. 2026 г.минутаот0,66 ₽/мин
NVIDIA: Parakeet TDT 0.6B v3Parakeet TDT 0.6B v3 — это многоязычная модель преобразования речи в текст NVIDIA с 600 млн параметров, построенная на архитектуре FastConformer-TDT. Обученный на наборе данных Gra…Вход: Аудио→Выход: Транскрипция27 мая 2026 г.Ввод (аудио)от2 746 ₽/M
Google: Gemini Embedding 2Gemini Embedding 2 — первая мультимодальная модель внедрения Google. В настоящее время мы поддерживаем отображение текста и изображений в единое векторное пространство для семантич…Вход: ТекстВход: ИзображенияВход: ФайлВход: АудиоВход: Видео→Выход: Эмбеддинги20 мая 2026 г.8K contextЭмбеддингот22 ₽/Mтокены изображенияот49 ₽/Mвход аудиоот714 ₽/M
Google: Gemini Embedding 2 (batch)Gemini Embedding 2 — первая мультимодальная модель внедрения Google. В настоящее время мы поддерживаем отображение текста и изображений в единое векторное пространство для семантич…Вход: ТекстВход: ИзображенияВход: ФайлВход: АудиоВход: Видео→Выход: Эмбеддинги20 мая 2026 г.8K contextЭмбеддинг11 ₽/M
Google: Gemini 3.5 FlashacademiaПравоНаукаGemini 3.5 Flash — это высокоэффективная мультимодальная модель Google, обеспечивающая кодирование и анализ на уровне профессионального уровня при стоимости и скорости уровня Flash…Вход: ТекстВход: ИзображенияВход: ВидеоВход: ФайлВход: Аудио→Выход: Текст19 мая 2026 г.1.0M contextВводот11 ₽/MВыводот67 ₽/MКэшот1 ₽/Mтокены изображенияот82 ₽/Mкэш аудиоот16 ₽/Mвход аудиоот165 ₽/Mрассуждениеот494 ₽/Mвеб-поискот1,54 ₽
Google: Gemini 3.5 Flash (batch)Gemini 3.5 Flash — это высокоэффективная мультимодальная модель Google, обеспечивающая кодирование и анализ на уровне профессионального уровня при стоимости и скорости уровня Flash…Вход: ТекстВход: ИзображенияВход: ВидеоВход: ФайлВход: Аудио→Выход: Текст19 мая 2026 г.1.0M contextВводот82 ₽/MВыводот494 ₽/MКэшот8,33 ₽/M