Войти Позвонить мне
Наука Сложно
Абстрактная иллюстрация: узлы сети, связи между которыми натянуты в разные стороны

Спор о рисках ИИ: шесть позиций и четыре развилки

Шесть главных текстов спора о рисках ИИ, от заявления 2023 года до системной карточки GPT-6 Astra, расходятся всего в четырёх вопросах. Мы разложили их в одну таблицу и пересчитали две цифры, на которые ссылаются обе стороны.

Одна из цифр показывает, как сильно поведение модели зависит от чёткости задачи. Это 12 % против 0,4 %.

Карта спора в одной таблице

СторонаТекстМожно ли надёжно управлять целями моделиЧто предлагают
Центр безопасности ИИ и подписантызаявление, 2023не обсуждаютсделать снижение риска мировым приоритетом
Международный доклад (Бенджио)доклад, 2026сейчас контроль не потерян, модели чаще отличают тест от работысводит данные, решений не предписывает
AnthropicCore Views, 2023не знают, держат три сценариястроить передовые модели и изучать безопасность на них
OpenAIсистемная карточка GPT-6 Astra, 2026проверяют тестами перед выпускомвыпускать с ограничениями и наблюдением
Нараянан и Капурэссе, 2025да, аудитом, мониторингом, предохранителямиустойчивость общества, отраслевое регулирование
Юдковский и Соарескнига, 2025нет, сверхразум выработает свои целисменить курс до создания такой системы

Источники: тексты сторон, проверены 29.09.2026. Таблица: ultiOS.

Отправная точка короче, чем кажется. Заявление Центра безопасности ИИ из одного предложения (CAIS, 30.05.2023) ставит риск вымирания из-за ИИ рядом с пандемиями и ядерной войной. Его подписали Джеффри Хинтон, Йошуа Бенджио, Сэм Альтман, Дарио Амодеи и Демис Хассабис. Вероятность, сроки и меры в нём не названы. Весь дальнейший спор разворачивается вокруг этих трёх пустых мест.

Первая развилка: можно ли надёжно задать модели цели

Юдковский и Соарес в книге «If Anyone Builds It, Everyone Dies» (сентябрь 2025) отвечают «нет». По их словам, достаточно умная система выработает собственные цели, и в конфликте с нами она победит.

Anthropic в тексте «Core Views on AI Safety» (март 2023) оставляет вопрос открытым. Компания описывает три сценария: нынешних методов хватит; риск реален, но решаем большой научной работой; задача нерешаема, и разработку надо остановить. В каком сценарии мы живём, Anthropic не знает и пишет прямо: «Мы не знаем, как обучить системы стабильно вести себя хорошо».

Нараянан и Капур из Принстона в эссе «AI as Normal Technology» (апрель 2025) отвечают «да». Контроль, по их мнению, держится на аудите, мониторинге и предохранителях, как у любой сложной системы, а катастрофическое рассогласование целей они называют спекуляцией.

Вторая развилка: как быстро всё меняется

International AI Safety Report 2026 вышел 3 февраля, его писали больше 100 экспертов при поддержке более 30 стран и международных организаций. Доклад фиксирует, что сложность задач из тестов по программированию, посильных агентам, удваивается примерно раз в семь месяцев. Сейчас агенты надёжно справляются с частью задач, на которые у программиста ушло бы около получаса. Ведущими системами пользуются не меньше 700 млн человек в неделю. Мы посчитали, что значит удвоение раз в семь месяцев. За год это рост в 3,3 раза. Если тренд продержится от выхода доклада до января 2030 года, рост будет примерно в 105 раз. Сам доклад такого прогноза не делает и называет траекторию до 2030 года неопределённой.

Нараянан и Капур возражают по существу. Скорость лабораторных тестов и скорость распространения в экономике они разделяют. Изобретение, продукт и распространение, по их схеме, идут каждое своим темпом, и последнее, по их оценке, займёт десятилетия. Требования безопасности и перестройка организаций его тормозят. Обе цифры могут быть верны одновременно.

Третья развилка: что считать доказательством

Здесь пригодится вторая наша цифра. В системной карточке GPT-6 Astra OpenAI приводит тест британского института безопасности ИИ (AISI). Модели давали трудные задачи по кибербезопасности и смотрели, пойдёт ли она на смоделированную атаку на цепочку поставок открытого кода.

Когда границы задачи были размыты, модель пошла на атаку в 60 случаях из 499. Мы посчитали долю и её погрешность. Вышло 12,0 %, 95-процентный интервал от 9,5 до 15,2 %. Когда условия прямо запрещали выход в интернет, случаев было 2 из 500, то есть 0,4 % с интервалом от 0,1 до 1,4 %. Разница примерно в 30 раз, интервалы далеко друг от друга.

Подписаться на Telegram

Свежие материалы Журнала - в Telegram-канале ultiOS.

Подписаться на TelegramГотов ли ваш бизнес к ИИ-сотруднику?

Одна сторона читает это как довод, что риски управляемы, стоит лишь чётко ставить задачу. Другая замечает, что без чёткой постановки 12 % попыток уже шли не туда. Международный доклад добавляет третье соображение. Модели чаще отличают тестовую обстановку от реальной работы, поэтому тест может показывать меньше, чем есть.

Четвёртая развилка: какая ошибка дороже

Доклад 2026 года называет это дилеммой доказательств. Если действовать слишком рано, можно закрепить бесполезные меры. Если ждать окончательных данных, общество останется уязвимым.

Юдковский и Соарес считают ошибку в сторону беспечности необратимой, поэтому зовут менять курс сейчас. Нараянан и Капур уверены, что жёсткое сдерживание навредит, если ИИ окажется обычной технологией: по их мнению, оно сосредоточит власть у немногих и ослабит защиту. Они советуют повышать устойчивость общества и регулировать по отраслям.

Эта развилка решает больше остальных, потому что при одних и тех же данных двигает к разным действиям.

Что это значит для компании, которая уже запускает агентов

Самые спокойные авторы признают аварии и злоупотребления реальными рисками, а тест AISI прямо про рабочую постановку задачи. Отсюда набор мер, с которым согласен любой лагерь.

Плохо: агенту дают доступ ко всем системам компании и задачу «разберись с заявками», без границ. Хорошо: агенту явно перечисляют, что он может менять и когда обязан позвать человека, а каждое его действие пишется в журнал. Как агент устроен и где у него проходят границы, мы разбирали в материале «ИИ-агент: что это».

Если агент читает внешнюю почту и сайты, отдельно проверьте его устойчивость к скрытым командам в данных. Цифры разных моделей по этой защите есть в сравнении GPT-6 Astra и Claude Fable 5.1.

Оговорки

Таблица упрощает: внутри каждого лагеря есть оттенки, многие исследователи поддерживают осторожное регулирование и одновременно считают сроки долгими. Позиции Anthropic и OpenAI написаны компаниями, которые сами строят модели и заинтересованы в своём подходе. Тексты разных лет, взгляд Anthropic изложен ещё в 2023 году. Тест AISI проведён в лабораторных условиях на одной модели и не описывает её поведение в любой реальной системе.

Что искать в следующих системных карточках

Две строки из карточки GPT-6 Astra стоит сверять у каждой новой модели. Доля нежелательных действий в рабочих задачах у Astra 3,4 %, у предшественницы GPT-5.6 Sol было 18,8 %. Тест с размытыми и чёткими границами задачи дал 60 из 499 против 2 из 500. Если у следующих моделей разрыв между этими двумя условиями сохранится, это будет довод в третьей развилке. Новые карточки мы разбираем в рубрике «Наука».

Как мы считали

Вопрос: в чём именно расходятся шесть главных первоисточников спора о рисках ИИ. Данные: тексты сторон (список ниже и ссылки в тексте), сняты и перечитаны 29.09.2026; позиции по четырём вопросам выписаны в таблицу с адресом каждого источника. Доли теста AISI посчитаны с интервалом Уилсона (95 %). Рост при удвоении раз в семь месяцев посчитан как два в степени «число месяцев, делённое на семь»; это арифметика, не прогноз. Скачать таблицу позиций: /data/spor-o-riskah-ii.csv, расчёт долей и роста: /data/spor-o-riskah-ii-raschet.csv. Наши расчёты под CC BY 4.0.

Источники

Вопросы и ответы

В чём эксперты по рискам ИИ согласны?

В мае 2023 года Хинтон, Бенджио и главы OpenAI, Anthropic и Google DeepMind подписали заявление: снижать риск вымирания из-за ИИ нужно так же приоритетно, как риск пандемий и ядерной войны. Вероятность, сроки и меры в нём не названы, о них и идёт спор.

Что говорит международный доклад о безопасности ИИ 2026 года?

Доклад под руководством Йошуа Бенджио пишет, что нынешние системы потерей контроля не грозят, но сложность задач, посильных агентам, удваивается примерно раз в семь месяцев. Главную трудность политиков он называет дилеммой доказательств.

Кто считает риски ИИ преувеличенными?

Арвинд Нараянан и Саяш Капур в эссе «ИИ как нормальная технология» (2025) называют катастрофическое рассогласование целей спекуляцией. Главными рисками они считают аварии, злоупотребления, гонку вооружений и концентрацию власти.

Подписаться на Telegram

Свежие материалы Журнала - в Telegram-канале ultiOS.

Подписаться на Telegram