Gemini 4 Argon лидирует в тестах на фоне снижения значимости бенчмарков
Google представила результаты Gemini 4 Argon, где модель лидирует в 12 из 18 тестов. Ранее Gemini 3.1 Pro с аналогичной таблицей результатов уступила Claude в реальных задачах более 300 очков. Ситуация демонстрирует, что победа в тестах все меньше говорит о фактическом качестве работы моделей.
Читать в первоисточнике — Хабр ↗
Ещё в ленте
Circuit Breaker Labs разработала решение для защиты пользователей от психологического вреда ИИ
Компания Circuit Breaker Labs создала виртуальные аналоги краш-тест манекенов для проверки безопасности искусственного интеллекта. Разработка призвана предотвратить психологический вред, который ИИ-системы могут наносить детям и взрослым пользователям.
Как устроена базовая нейросеть: разбор принципов работы без калькулятора
Автор статьи подготовил наглядное объяснение базовых принципов работы нейронных сетей без применения компьютера и калькулятора. Материал оформлен в виде письма, в котором логика вычислений и матричных операций демонстрируется на примере решения задачи XOR.
Руководство OpenAI по выбору и настройке моделей семейства GPT-6
OpenAI представила руководство для стартапов по работе с семейством моделей GPT-6. В публикации рассказывается о подборе моделей, регулировке глубины рассуждений, улучшении промптов и координации инструментов. Также рассматривается подготовка рабочих процессов к запуску в продакшене.
Инвестиции в искусственный интеллект достигнут 2,5 трлн долларов к 2026 году
Корпоративный искусственный интеллект переходит в стадию активного практического применения. Возможности моделей растут быстрее способности компаний их осваивать, при этом стоимость производительности продолжает снижаться. По прогнозам, к 2026 году мировые инвестиции в сферу AI увеличатся на 44% и составят 2,5 триллиона долларов.