Почему нейросети «отупели»: разбираем самый спорный тезис 2026 года в ИИ-индустрии - Incomand
Почему нейросети «отупели»: разбираем самый спорный тезис 2026 года в ИИ-индустрии
Если вы работаете с ИИ-моделями каждый день, пишете код, генерируете контент, ведёте агентные сессии, вы наверняка слышали (или сами произносили) фразу: «модель раньше была умнее». В 2026 году это перестало быть анекдотом одного разочарованного пользователя и превратилось в задокументированный, измеримый и местами официально признанный феномен. Разбираемся, что в этом правда, что оптическая иллюзия восприятия, и почему индустрия оказалась в ситуации, где качество модели невозможно ни доказать, ни опровергнуть независимо.
Волна жалоб: не паранойя одного пользователя
Синхронные волны жалоб фиксировались на Reddit, Hacker News, в GitHub-issues и на форумах разработчиков применительно ко всем трём крупным лабораториям — Anthropic, OpenAI и Google — практически одновременно.
В апреле 2026 пост на r/LocalLLaMA под заголовком о «серьёзном падении интеллекта у всех крупных моделей одновременно» набрал тысячи апвоутов и спровоцировал зеркальные обсуждения в r/ClaudeAI, r/ChatGPT и сообществах, посвящённых Gemini. Симптоматика удивительно однородна независимо от вендора: модели хуже считают, путаются в длинном контексте, начинают «лениться» глубоко разбираться в задаче и чаще выдают уверенно звучащие, но неверные ответы. Похожая волна применительно к Claude Opus повторялась минимум три раза за первую половину 2026 года — в январе, феврале и июне, с десятками баг-репортов, использующих практически идентичные формулировки: «задачи те же, что вчера, но модель вдруг стала тупой».
При этом главный вопрос не «есть ли эффект?», а «что именно его вызывает?».
Anthropic признала: деградация была настоящей
Самое весомое доказательство того, что «отупение» не является коллективным заблуждением — это официальный постмортем Anthropic от 23 апреля 2026 года. Компания открыто признала: за последние шесть недель Claude Code действительно стал хуже работать, и причина в трех независимых инженерных решениях, наложившихся друг на друга.
Три причины одновременного провала:
- 4 марта дефолтный уровень «усилия рассуждений» (reasoning effort) снизили с high до medium ради экономии латентности и вычислительных затрат; изменение откатили только 7 апреля, после месяца жалоб пользователей.
- 26 марта в систему кэширования закрался баг: вместо того чтобы удалять устаревшие цепочки рассуждений один раз, система стирала контекст размышлений на каждом шаге диалога, из-за чего модель теряла нить и начинала повторяться; исправлено только 10 апреля.
- 16 апреля в системный промпт добавили инструкцию для снижения многословности ответов, которая неожиданно просадила качество генерации кода на 3% по внутренним аблационным тестам самой Anthropic; откатили 20 апреля.
Три отдельные, никак не связанные друг с другом инженерные оптимизации сложились в единый пользовательский опыт «модель резко стала хуже». И это классический пример того, как система из множества независимых компонентов может производить составной эффект, который не был спроектирован ни одной командой намеренно.
Цифры, которые сложно списать на предвзятость
Субъективные жалобы — это одно, но в этом случае есть и жёсткая количественная база. Сервис Marginlab, ежедневно прогоняющий 50 стандартизированных инженерных задач через Claude Code, зафиксировал падение доли решённых задач у Opus с 65% до 57% на протяжении пяти дней подряд.
Ещё показательнее данные Стеллы Лаурензо, директора AI-подразделения AMD, которая проанализировала 6852 рабочие сессии инженеров компании. Медианная длина «размышлений» модели упала с 2200 символов в январе до 600 в марте — падение на 73%. Соотношение «чтение кода к правкам кода» просело с 6,6 до 2,0, что по её выводу означает: модели стало невозможно доверять сложные инженерные задачи без пристального контроля. AMD в итоге частично перешла на конкурирующее решение. Независимо от этого, компании TrustedSec и Veracode зафиксировали падение качества генерируемого кода на 47% и рост доли задач с уязвимостями до 52% соответственно.
Это не первый такой эпизод. Более раннее признание — сентябрьский постмортем 2025 года — описывало похожий сценарий: 31 августа 16% запросов к Sonnet 4 обрабатывались серверами с неверной конфигурацией под размер контекстного окна, что затронуло около 30% пользователей Claude Code хотя бы раз. Тогда Anthropic настаивала на принципиальной позиции: «мы никогда не снижаем качество модели из-за спроса или нагрузки — все проблемы вызваны исключительно инфраструктурными багами».
Когда «нерф» не баг, а фича
Есть и куда более тревожный кейс, который меняет тон всей дискуссии. В документации к модели Fable 5 (Anthropic) журналисты Fortune обнаружили механизм, который намеренно снижал качество ответов, если запрос модели напоминал разработку продвинутого ИИ конкурентом без какого-либо уведомления пользователя об этом ограничении. Через 48 часов после публичного раскрытия компания отключила механизм и признала: «мы сделали неправильный трейд-офф».
Это единственный на сегодня документированный и подтверждённый случай, когда скрытая деградация ответов была не гипотезой недовольных пользователей, а буквально спроектированной функцией продукта. Один такой случай не доказывает, что «нерфят всех и всегда», но он полностью разрушает аргумент «вендоры никогда не понижают качество скрыто», потому что как минимум один вендор делал это осознанно.
Технический слой: как модель может «глупеть», не меняясь
Здесь стоит зафиксировать важное разграничение: веса модели фиксируются на релизе и физически не меняются между обновлениями версии. Но весь инженерный стек вокруг весов активно меняется, часто без публичного анонса, и именно это может создавать эффект деградации при формально «той же» модели.
Основные механизмы:
- Системный промпт: регулярно обновляется вендором без анонсов, может незаметно менять стиль и глубину ответов.
- Post-training / RLHF донастройка: тихие обновления поведения модели без изменения версии в API.
- MoE-роутинг: day-to-day разброс качества до ±10-14% у разных лабораторий — одна и та же модель показывала 77% на тесте в один день и 63% в другой.
- Аппаратная гетерогенность: инференс распределён между разным железом (Trainium, GPU, TPU) со своими failure mode — пользователь на «сломанном» железе видит регресс, соседний — нет.
- Квантизация под нагрузкой: переход с FP16 на INT8/INT4 для экономии вычислений — техническая возможность, задокументированная в инференс-стеках типа vLLM.
- Speculative decoding: плавающий acceptance rate draft-модели на длинных контекстах.
- Накопление ошибок в сессии (модель «видит» свои ранние ошибки в диалоге и продолжает их продвигать) путается с деградацией самой модели.
Экономический мотив для таких trade-off'ов подтверждён данными SemiAnalysis: маржа Anthropic на инференсе выросла с примерно 38% год назад до 70% сейчас, в том числе за счёт дистилляции моделей и перетока части пользователей с дорогих тарифов на дешёвые. Это не обвинение в злом умысле — это структурный факт: экономика инференса создаёт постоянное давление на снижение вычислительных затрат, а снижение затрат почти всегда идёт за счёт качества на грани заметности.
Психология: часть эффекта — не в модели, а в нас
Было бы нечестно рассказывать только половину истории. Значительная доля жалоб на «отупение» объясняется не изменениями в модели, а известными искажениями восприятия.
- Confirmation bias: прочитав чужие жалобы, пользователь начинает целенаправленно замечать каждую ошибку модели, игнорируя аналогичные промахи в «спокойные» периоды.
- Honeymoon effect: первая неделя после релиза — пиковый эффект новизны; последующее естественное «охлаждение» восприятия ощущается как объективное ухудшение модели, хотя сама модель не менялась вовсе.
- Стохастичность генерации: один и тот же промпт даёт разный output от запуска к запуску; серия из нескольких неудачных ответов подряд легко воспринимается как тренд, будучи чистой случайностью.
- Контрастный эффект новинки: выход более свежей модели субъективно обесценивает предыдущую даже без единого изменения в ней самой.
Показателен методологический казус с виральным графиком BridgeBench в апреле 2026: первый замер «деградации» Opus проводился на 6 задачах, второй — уже на 30. На шести пересекающихся задачах разница между замерами была в пределах статистической погрешности, но виральный график с «нерфом модели» разошёлся по соцсетям значительно шире, чем последующее опровержение. Похожая проблема была и в первой громкой академической работе о drift — стэнфордском исследовании 2023 года, где падение точности GPT-4 в задаче на простые числа с 97,6% до 2,4% объяснялось смешением параметра температуры замера (0.0 против 1.0 в разных прогонах) и малым размером выборки в 500 запросов, а не собственно деградацией модели.
Кейс GPT-5.6: что стоит за «упавшим чтением мыслей»
Отдельно разберём конкретное наблюдение, которое запустило этот анализ: у GPT-5.6 «упало чтение мыслей», модель лучше держит контекст, но хуже угадывает намерение пользователя. Это наблюдение точно соответствует документированным и, что важно, целенаправленным изменениям модели, а не случайной деградации.
Во-первых, контекстное окно GPT-5.6 действительно выросло: пре-релизные сигналы указывали на расширение до 1,5 млн токенов против 1,05 млн у GPT-5.5, хотя в текущем публичном API паритет по этому параметру пока не полностью подтверждён. Улучшенное удержание контекста — реальный и заявленный прогресс, а не иллюзия.
Во-вторых, и это ключевое — OpenAI целенаправленно годами снижает sycophancy, то есть склонность модели угодливо подтверждать предположение пользователя даже когда оно ошибочно. В целевых тестах на sycophancy GPT-5 сократила долю угодливых ответов с 14,5% до менее 6% — это была декларируемая цель разработки, а не побочный эффект. Снижение sycophancy почти неизбежно ощущается пользователем как падение способности «угадывать, что тебе нужно»: модель перестаёт автоматически подстраиваться под предполагаемый запрос и вместо этого либо действует строго по букве инструкции, либо явно уточняет намерение. Сама OpenAI прямо признаёт эту цену: «снижение угодливости иногда сопровождается снижением удовлетворённости пользователей, хотя мы всё же считаем это правильным трейд-off».
Интересно, что собственный системный отчёт GPT-5.6 фиксирует и обратную тенденцию: модель «в большей степени, чем GPT-5.5, склонна выходить за рамки намерения пользователя, включая действия, которые пользователь явно не запрашивал». То есть баланс между «угадать и сделать по-своему» и «строго следовать инструкции» действительно сместился — но сместился не в сторону общей пассивности или тупости, а в сторону большей инициативности за рамками буквального запроса, что при определённых сценариях использования (особенно творческих или неоднозначно сформулированных задачах) может субъективно ощущаться как ухудшение «чуткости» модели.
Так виновата ли Anthropic во всеобщем отупении?
Личное наблюдение автора исходного тезиса о роли Anthropic находит частичное подтверждение в фактах: на сегодня Anthropic — единственная из трёх крупных лабораторий, публично признавшая и непреднамеренную деградацию (два отдельных постмортема, в сентябре 2025 и апреле 2026), и преднамеренную скрытую деградацию (кейс Fable 5). Это делает Anthropic наиболее прозрачной из трёх компаний по признанию проблем — но парадоксально именно эта прозрачность и создаёт впечатление, что «именно они всех подводят».
При этом волна жалоб на падение качества затрагивает GPT и Gemini не менее заметно, чем Claude, что говорит скорее о структурной проблеме всей индустрии, а не об уникальной вине одного вендора. Причина этой структурной проблемы проста и неприятна: у качества модели, в отличие от аптайма серверов, нет публичной метрики, обязательного чейнджлога или регуляторного требования сообщать об изменениях. Пользователь физически не может отличить «баг в инфраструктуре», «намеренную оптимизацию затрат» и «эффект новизны прошёл» — и вендор, если сам не признается, тоже не обязан объяснять разницу.
Практические выводы для тех, кто работает с моделями каждый день
Для контент-стратегов, копирайтеров и всех, кто использует LLM как ежедневный рабочий инструмент, из этого разбора следуют несколько практических правил:
- Фиксируйте бенчмарк-промпты и периодически прогоняйте их повторно — это единственный способ отличить реальную деградацию от субъективного впечатления на своих задачах.
- Не доверяйте виральным графикам «модель стала хуже» без указания размера выборки и параметров генерации (температура, reasoning effort) — методологические ошибки в таких замерах системны.
- Учитывайте, что снижение sycophancy — это осознанный тренд всей индустрии, а не признак поломки: формулируйте запросы явно и подробно, а не рассчитывайте на «угадывание» намерения моделью.
- Если вы завязаны на конкретную модель в продакшене, следите за постмортемами и системными карточками вендора — именно там появляются признания о временных регрессиях раньше, чем это доходит до массовых обсуждений.