🤖 Microsoft выпустила три продакшен-модели MAI для речи и изображений Microsoft представила сразу три специализированны
Microsoft представила сразу три специализированные модели под брендом MAI, предназначенные для коммерческого использования с конкурентной стоимостью инференса.
MAI-Transcribe-1 — speech-to-text модель для 25 языков (включая русский). Показывает лучший Word Error Rate (3,86%) на бенчмарке FLEURS, обходя Whisper на всех языках и Gemini 3.1 Flash в 22 из 25. Стоимость: $0,36 за час аудио.
MAI-Voice-1 — TTS-модель с клонированием голоса и эмоциональной окраской. Генерирует 1 минуту аудио за секунду, поддерживает управление эмоциями через SSML. Пока только английский, стоимость: $22 за 1 млн символов.
MAI-Image-2 — диффузионная модель с 10-50 млрд параметров, контекстом до 32K токенов и разрешением 1024×1024. По Elo-рейтингу (1190 баллов) значительно превосходит предшественницу, особенно в фотореалистичных сценах. Стоимость: $5 за 1 млн токенов ввода, $33 за 1 млн токенов вывода.
Все модели доступны через Microsoft Foundry, но интерактивная среда MAI Playground пока работает только из США.
🧠 Нейросети и Технологии. Подписаться