OpenAI выкатили результаты тестирования GPT-5.2, и они пугают. Нейросеть вплотную приблизилась к уровню человеческого мышления там, где раньше машины пасовали.
Главный шок — тест ARC-AGI-2. Это набор визуальных головоломок на абстрактную логику, созданный специально, чтобы ломать алгоритмы. Средний человек решает его на 60%. GPT-5.2 выдала 54%. Разрыв сократился до статистической погрешности.
В точных науках машине уже нет равных. На сложнейшем экзамене AIME 2025 (теория чисел, комбинаторика, геометрия) версия GPT-5.2 Thinking впервые в истории набрала 100%, не допустив ни одной ошибки. А в тесте GDPval (выполнение реальных рабочих задач за деньги) ИИ показал результат в 74%, что выше уровня среднего специалиста-человека.
Мы наблюдаем смерть аргумента «нейросеть не понимает, она имитирует». Результат в ARC-AGI-2 доказывает: модель научилась видеть закономерности и применять логику в незнакомых ситуациях, а не просто вспоминать заученное. А 100% в математике означают, что ИИ больше не «галлюцинирует» в точных расчетах.
Источник: Телеграм