Self-improving AI быстро становится маркетинговой формулой. Один продукт «самоулучшается», потому что запоминает предпочтения пользователя. Другой — потому что агент способен переписать prompt. Третий анализирует production feedback и меняет workflow. Четвёртый действительно участвует в создании следующей версии самого себя.
Для бизнеса эти различия критичны. Чем выше автономия улучшения, тем сложнее change management, audit и ответственность.
В сентябре 2026 года группа исследователей опубликовала обзор The Last AI Built by Humans, в котором были классифицированы 491 работа и система. Авторы предложили шкалу L1–L5 не как рейтинг «умности», а как карту передачи решений об улучшении от человека к машине.
L1 — самый простой уровень. Люди определяют, что изменить, как изменить и как проверить результат. ИИ выполняет работу. Такой агент может экономить сотни часов, но архитектура решения остаётся человеческой.
На L2 человек по-прежнему задаёт цель и evaluator, однако система сама ищет слабое место и выбирает intervention. Например, coding-agent получает benchmark и самостоятельно решает, какой компонент workflow переписать.
На L3 система начинает выбирать собственный обучающий опыт. Она может генерировать задачи, искать неудачные случаи и решать, какой тип практики нужен следующей версии.
L4 особенно интересен бизнесу, потому что improvement loop связывается с production. Реальные ошибки пользователей превращаются в изменения, которые сохраняются для будущих сессий.
Именно здесь находятся некоторые современные коммерческие примеры. OpenAI описывала Tax AI, созданный вместе с Thrive: исправления налоговых специалистов превращаются в structured traces и evals, а Codex помогает улучшать систему. Factory публиковала описание Signals — механизма, который анализирует реальные сессии Droid, находит повторяющиеся точки трения и превращает их в задачи для исправления.
В обоих случаях важна деталь: речь идёт не просто о том, что модель «передумала». Изменение сохраняется и влияет на дальнейшую работу продукта.
L5 начинается там, где система получает возможность менять сам механизм следующего улучшения: evaluator, search policy, candidate generator или правила выбора преемника. Это принципиально более сложный уровень, потому что объект и способ оптимизации начинают меняться вместе.
Связанный разбор: материал Finbi о RSI.
Для бизнеса здесь появляется несколько новых вопросов.
Первый — versioning. Если self-improving system меняет память, code, workflow и evaluator, обычного номера релиза недостаточно. Нужно знать полное состояние improvement loop.
Второй — rollback. Вернуть предыдущий git commit мало, если новая версия уже записала изменения в persistent memory или library of skills.
Третий — independent evaluation. Если агент многократно видит один benchmark, он может постепенно оптимизироваться именно под него. А если система может менять evaluator, возникает ещё более сложная проблема: новая версия может выглядеть лучше потому, что изменилась сама шкала.
Четвёртый — compute budget. Улучшение, полученное за счёт десятикратно большего числа попыток, нельзя автоматически считать более эффективным механизмом саморазвития.
Хороший исследовательский пример — Darwin Gödel Machine. Система создаёт модифицированные версии coding agents, проверяет их и сохраняет успешные линии. Авторы показали значимый рост результатов на задачах программирования. Но даже этот проект полезно рассматривать без магии: часть правил отбора и инфраструктуры остаётся внешней.
В сентябре 2026 года OpenAI отдельно сообщила о достижении уровня automated research intern: агент способен под человеческим руководством выполнять хорошо определённые исследовательские задачи, на которые квалифицированному специалисту потребовались бы дни. Это уже серьёзное ускорение R&D, но ещё не автономная лаборатория, которая сама определяет стратегию и выпускает своего преемника.
Anthropic формулирует границу похожим образом. Компания пишет, что Claude уже ускоряет разработку Claude, однако прямо указывает: полного recursive self-improvement пока нет и он не неизбежен.
Для руководителя вывод практический. Не стоит спрашивать поставщика только «умеет ли ваш продукт самоулучшаться?». Лучше выяснить, что сохраняется между сессиями, кто выбирает улучшение, кто контролирует evaluator, можно ли откатить изменение, как фиксируется lineage и кто принимает финальное решение о release.
Self-improving AI может стать сильным преимуществом там, где много повторяющихся рабочих циклов. Но чем больше решений об улучшении система принимает сама, тем меньше она похожа на обычный SaaS и тем больше — на постоянно изменяющийся производственный процесс.
