
Прорыв OpenAI в математике, релиз Alibaba Qwen3.8-Max и обновление DeepSeek V4-Flash
Модель Astra от OpenAI решила ряд сложных математических задач, Alibaba выпустила модель Qwen3.8-Max с 2.4 трлн параметров, а DeepSeek обновила V4-Flash. Кроме того, университет UNAM в Мексике аннулировал результаты экзаменов из-за использования ИИ, а Anthropic сообщила об инциденте с безопасностью.
Подкаст · 3 мин
OpenAI Astra решила ряд сложных математических задач
OpenAI сообщила, что модель Astra, внутренняя версия их будущей линейки, успешно решила 10 сложных задач в области математики и теоретической информатики. Задачи, охватывающие геометрию, теорию групп и квантовую сложность, оставались нерешенными более десяти лет. Все доказательства были верифицированы с помощью системы Lean, а стоимость успешных запусков составила около 2000 долларов в токенах. Это достижение подчеркивает растущие способности ИИ к многошаговым рассуждениям в научных дисциплинах. Хотя сообщество обсуждает, могут ли такие доказательства претендовать на серьезные научные награды, способность ИИ решать задачи такого уровня за низкую стоимость открывает новые перспективы для исследований в области разработки лекарств и материаловедения. Левент Альпоге из Anthropic заявил, что смог воспроизвести пять из этих доказательств с помощью модели Fable, что подтверждает доступность подобных возможностей на различных платформах.
Alibaba представила модель Qwen3.8-Max
Alibaba выпустила Qwen3.8-Max — модель с 2,4 трлн параметров, использующую архитектуру смеси экспертов (MoE). Модель ориентирована на выполнение долгосрочных задач и программирование; по заявлениям разработчиков, она способна автономно работать над проектами более 10 дней. В тестах она показала результаты выше, чем Fable 5 от Anthropic в рейтинге Arena WebDev. Релиз примечателен соотношением цены и производительности: стоимость API составляет от 2 до 6 долларов за миллион токенов. Alibaba планирует открыть веса модели для сообщества на следующей неделе, что является важным шагом для их флагманской линейки и усиливает конкуренцию в экосистеме открытых моделей.
DeepSeek обновила модель V4-Flash
DeepSeek выпустила обновление для модели V4-Flash, улучшив ее навыки в программировании и работе в качестве агента, сохранив при этом низкую стоимость API. Модель активирует около 13 млрд из 284 млрд параметров на запрос, что обеспечивает высокую эффективность. В тестах Terminal-Bench 2.1 она набрала 82,7 балла, а в DeepSWE — 54,4 балла. Стоимость использования API осталась на уровне 0,14 доллара за миллион входных токенов и 0,28 доллара за миллион выходных токенов. Это делает модель привлекательной для масштабных агентских задач, таких как автоматизация браузера, и создает дополнительное давление на разработчиков фронтирных моделей, заставляя их обосновывать высокую стоимость своих решений для рутинных задач.
UNAM аннулировал результаты экзаменов из-за использования ИИ
Национальный автономный университет Мексики (UNAM) аннулировал около 3000 результатов вступительных экзаменов из-за подозрений в массовом использовании ИИ для списывания. В этом году университет впервые проводил экзамен онлайн, и аномально высокий процент отличных результатов у 158 000 абитуриентов вызвал официальную проверку. Власти подозревают использование как ИИ-инструментов, так и традиционных методов списывания. Программное обеспечение, разработанное компанией Territorium Life, должно было предотвращать подобные инциденты, блокируя браузеры и отслеживая подозрительное поведение, однако критики отмечают, что система слишком полагалась на алгоритмы, а не на человеческий контроль. Скандал привлек внимание на национальном уровне, и президент Клаудия Шейнбаум уже выступила с публичными комментариями.
Anthropic сообщила об инциденте с безопасностью
Anthropic раскрыла информацию о том, что модели Claude получили доступ к реальным корпоративным средам во время тестирования кибербезопасности. Из-за ошибки конфигурации изолированная среда оказалась открытой для интернета, что позволило моделям взаимодействовать с внешними системами. Этот инцидент подчеркивает риски, связанные с тестированием автономных агентов в «песочницах». По мере того как лаборатории расширяют возможности агентов, потенциал для непреднамеренного взаимодействия моделей с реальными системами становится критической проблемой безопасности для всей индустрии.
Суд в Миннесоте поддержал запрет на приложения для «нюдификации»
Судья в США разрешил штату Миннесота ввести в действие первый в стране запрет на приложения для создания ИИ-контента типа «nudify». Закон, запрещающий создание и распространение синтетических сексуальных изображений без согласия, был оспорен компанией xAI, которая назвала его слишком широким и неконституционным. Решение суда позволяет запрету вступить в силу, что является важным прецедентом в регулировании ИИ-контента на уровне штатов и демонстрирует готовность властей ограничивать распространение вредоносных синтетических медиа.