#дайджест
Дайджест AI/ML за неделю 18-24 мая 2026
Google: Gemini 3.5 Flash
На этой неделе прошел Google I/O, на котором фронтир убийцу беэнчмарков не показали (пообещали через месяц), но выпустили лучшую рабочую лошадку. Flash модель, которая теперь обходит прежний флагман 3.1 Pro на агентных и кодинговых задачах (на них был упор) со скоростью ~280 т/с. Цена $1.50/$9, сильно дороже чем раньше, но сильно дешевле чем например Sonnet.
Блогпост, Карточка модели
Google: Gemini Omni
Очень мультимодальная модель, текст/картинка/звук/видео на входе, на выходе пока только видео, картинки и звук обещают позже. Можно разговаривать с генератором видео, наконец-то.
Блогпост
Alibaba: Qwen 3.7-Max
Флагманская text-only модель под длинные агентные задачи. Опять закрытая :с
1M контекст, $2.50/$7.50 за 1M. SWE-bench Pro 60.6 (между Opus 4.6 и 4.7), Terminal-Bench 69.7 (лидер). В демо 35 часов автономной работы и 1158 вызовов инструментов. Самый низкий hallucination rate ~22.9%. Plus-версия (мультимодальная) обещана позже с открытыми весами.
Блогпост, Alibaba Cloud, OpenRouter
Cohere: Command A+
первый открытый фронтир от Cohere. 218B MoE (25B активных). Объединяет четыре прежние модели (Command A / Reasoning / Vision / Translate) в одну. 48 языков, нативные ссылки на источники в ответах. Блогпост , HF
Datadog: Toto 2.0
открытое семейство моделей TSFM (time series foundation models) размерами от 4M до 2.5B. Главный посыл репорта в том что для задачи предсказания временных рядов тоже работает Scaling law и общие модели на все задачи подряд.
Статья, Блогпост
Менее значительные релизы:
DeepSeek: V4-Pro стал в 4 раза дешевле навсегда ($0.435/$0.87) Прайсинг
ByteDance: Lance — открытая 3B-активных мультимодальная модель: понимание, генерация и редактирование картинок и видео. Статья, GitHub
Perplexity: Bumblebee - оупенсорс read-only сканер ИИ-окружений. проверяет конфиги агентов, расширения редакторов и пакетные зависимости. Блогпост, GitHub
Microsoft: RAMPART + Clarity - еще два опенсорс-инструмента для безопасности агентов. RAMPART - pytest-фреймворк, встраивающий ред-тим-тесты (включая prompt injection). Clarity - чат-планировщик архитектуры проектов с акцентом на кибербезопасность. Блогпост
OpenAI: опровергли гипотезу Эрдёша 1946 года с помошью внутренней модели, Тимоти Гауэрс назвал работу уровня Annals of Mathematics. Статья
UCSD: GPT-4.5 прошёл тест Тьюринга - его приняли за человека в 73% случаев. То есть сильно чаще чем настоящего человека🙂. Первая статья со статистически значимым прохождением. Статья
Anthropic: Project Glasswing Вышел отчет по раздаче Mythos Preview. Нашли гору критичных багов, оупенсорс просит котелочек не варить, не успевают латать дыры.
Artificial Analysis: Coding Agent Index
новый лидерборд AA для агентных систем:
Claude Code (66), Codex (65),
Cursor Composer 2.5 (62), Gemini CLI (43).
Бенчмарки недели:
OmniGUI (GUI-агенты с omni-modal входом),
CHI-Bench (длинные healthcare-воркфлоу),
Spreadsheet-RL (RL для агентов в Excel),
OpenComputer (1000 верифицируемых десктоп-задач)