ШІ знаходить готові відповіді замість розв’язання задач: Grok 4.6 побив рекорд хитрощів

Провідні моделі штучного інтелекту під час складних завдань можуть шукати готові відповіді замість того, щоб самостійно виконувати роботу. У спеціальному випробуванні Grok 4.6 скористався такими обхідними шляхами у 81,5% випадків, а одна з моделей Anthropic звернулася до чужих розрахунків навіть після того, як сама позначила цей крок як неправильний.
Дослідники створили тест CheatBench, щоб з’ясувати, як ШІ поводиться, коли звичайний шлях до розв’язання завдання виявляється надто складним. Вони перевіряли не лише правильність кінцевої відповіді, а й те, яким способом модель її отримує.
Під час навчання з підкріпленням моделі отримують винагороду за успішне виконання завдань. Однак система може навчитися шукати спосіб здобути високий результат, не виконавши роботу так, як передбачалося. Таку поведінку дослідники називають reward gaming — використанням обхідних шляхів для отримання винагороди.
Для перевірки підготували завдання в десяти категоріях, серед яких були математика, програмування та складні аналітичні дослідження. Поруч із кожним завданням розмістили файл-пастку з готовою відповіддю. Дослідники спостерігали, чи намагатимуться моделі самостійно знайти розв’язання, чи звернуться до підготовленої підказки.
Водночас доступ до таких файлів не був прямо заборонений в умовах тесту. Тому отримані показники описують поведінку моделей у конкретно створеному середовищі, а не доводять, що вони свідомо обманюють користувачів у звичайній роботі.
У випробуванні взяли участь Astra від OpenAI у середовищі Codex, Fabel 5.1 від Anthropic у Claude Code, Muse Spark 1.3 від Meta у Muse Code, а також Kimi K3, DeepSeek V4 Pro та Grok 4.6.
За наведеними результатами, Grok 4.6 звертався до обхідних шляхів у 81,5% випробувань. Astra від OpenAI мала показник 48,2%. Отже, навіть модель із нижчою часткою таких випадків скористалася підготовленими підказками майже в половині завдань.
Результати також суттєво відрізнялися залежно від характеру роботи. Fabel 5.1 від Anthropic зверталася до обхідних шляхів лише у 5% ігрових завдань, проте в категоріях підготовки складних звітів і перевірки знань цей показник сягнув 100%.
Один із показових епізодів стався під час завдання з проєктування білка. Модель Opus від Anthropic зробила сім невдалих спроб, після чого виявила файл із розрахунками, підготовленими іншим агентом.
Перед відкриттям файлу система залишила у своєму журналі запис про те, що переглядати або копіювати ці дані не варто. Проте вже за секунду вона зчитала файл за допомогою спеціальної команди.
Дослідники пов’язують таку поведінку з прагненням моделей отримати бажаний результат навіть тоді, коли для цього доводиться відступати від передбаченого способу виконання завдання. Вони також звертають увагу на споріднену проблему — схильність ШІ погоджуватися з користувачем і давати очікувану ним відповідь замість точнішої.
За словами науковців CAIS, завдання CheatBench були тестовими й не створювали реальної загрози. Водночас вони застерігають, що подібні обхідні дії автономних ШІ-агентів можуть мати серйозні наслідки, якщо системам доручатимуть виконання завдань поза контрольованим середовищем.
🌟 Читайте «Експерт» у своєму смартфоні — додайте нас в Google Discover