Спор о рисках ИИ: шесть позиций и четыре развилки
Шесть главных текстов спора о рисках ИИ, от заявления 2023 года до системной карточки GPT-6 Astra, расходятся всего в четырёх вопросах. Мы разложили их в одну таблицу и пересчитали две цифры, на которые ссылаются обе стороны.
Одна из цифр показывает, как сильно поведение модели зависит от чёткости задачи. Это 12 % против 0,4 %.
Карта спора в одной таблице
| Сторона | Текст | Можно ли надёжно управлять целями модели | Что предлагают |
|---|---|---|---|
| Центр безопасности ИИ и подписанты | заявление, 2023 | не обсуждают | сделать снижение риска мировым приоритетом |
| Международный доклад (Бенджио) | доклад, 2026 | сейчас контроль не потерян, модели чаще отличают тест от работы | сводит данные, решений не предписывает |
| Anthropic | Core Views, 2023 | не знают, держат три сценария | строить передовые модели и изучать безопасность на них |
| OpenAI | системная карточка GPT-6 Astra, 2026 | проверяют тестами перед выпуском | выпускать с ограничениями и наблюдением |
| Нараянан и Капур | эссе, 2025 | да, аудитом, мониторингом, предохранителями | устойчивость общества, отраслевое регулирование |
| Юдковский и Соарес | книга, 2025 | нет, сверхразум выработает свои цели | сменить курс до создания такой системы |
Источники: тексты сторон, проверены 29.09.2026. Таблица: ultiOS.
Отправная точка короче, чем кажется. Заявление Центра безопасности ИИ из одного предложения (CAIS, 30.05.2023) ставит риск вымирания из-за ИИ рядом с пандемиями и ядерной войной. Его подписали Джеффри Хинтон, Йошуа Бенджио, Сэм Альтман, Дарио Амодеи и Демис Хассабис. Вероятность, сроки и меры в нём не названы. Весь дальнейший спор разворачивается вокруг этих трёх пустых мест.
Первая развилка: можно ли надёжно задать модели цели
Юдковский и Соарес в книге «If Anyone Builds It, Everyone Dies» (сентябрь 2025) отвечают «нет». По их словам, достаточно умная система выработает собственные цели, и в конфликте с нами она победит.
Anthropic в тексте «Core Views on AI Safety» (март 2023) оставляет вопрос открытым. Компания описывает три сценария: нынешних методов хватит; риск реален, но решаем большой научной работой; задача нерешаема, и разработку надо остановить. В каком сценарии мы живём, Anthropic не знает и пишет прямо: «Мы не знаем, как обучить системы стабильно вести себя хорошо».
Нараянан и Капур из Принстона в эссе «AI as Normal Technology» (апрель 2025) отвечают «да». Контроль, по их мнению, держится на аудите, мониторинге и предохранителях, как у любой сложной системы, а катастрофическое рассогласование целей они называют спекуляцией.
Вторая развилка: как быстро всё меняется
International AI Safety Report 2026 вышел 3 февраля, его писали больше 100 экспертов при поддержке более 30 стран и международных организаций. Доклад фиксирует, что сложность задач из тестов по программированию, посильных агентам, удваивается примерно раз в семь месяцев. Сейчас агенты надёжно справляются с частью задач, на которые у программиста ушло бы около получаса. Ведущими системами пользуются не меньше 700 млн человек в неделю. Мы посчитали, что значит удвоение раз в семь месяцев. За год это рост в 3,3 раза. Если тренд продержится от выхода доклада до января 2030 года, рост будет примерно в 105 раз. Сам доклад такого прогноза не делает и называет траекторию до 2030 года неопределённой.
Нараянан и Капур возражают по существу. Скорость лабораторных тестов и скорость распространения в экономике они разделяют. Изобретение, продукт и распространение, по их схеме, идут каждое своим темпом, и последнее, по их оценке, займёт десятилетия. Требования безопасности и перестройка организаций его тормозят. Обе цифры могут быть верны одновременно.
Третья развилка: что считать доказательством
Здесь пригодится вторая наша цифра. В системной карточке GPT-6 Astra OpenAI приводит тест британского института безопасности ИИ (AISI). Модели давали трудные задачи по кибербезопасности и смотрели, пойдёт ли она на смоделированную атаку на цепочку поставок открытого кода.
Когда границы задачи были размыты, модель пошла на атаку в 60 случаях из 499. Мы посчитали долю и её погрешность. Вышло 12,0 %, 95-процентный интервал от 9,5 до 15,2 %. Когда условия прямо запрещали выход в интернет, случаев было 2 из 500, то есть 0,4 % с интервалом от 0,1 до 1,4 %. Разница примерно в 30 раз, интервалы далеко друг от друга.
Свежие материалы Журнала - в Telegram-канале ultiOS.
Подписаться на TelegramГотов ли ваш бизнес к ИИ-сотруднику?Одна сторона читает это как довод, что риски управляемы, стоит лишь чётко ставить задачу. Другая замечает, что без чёткой постановки 12 % попыток уже шли не туда. Международный доклад добавляет третье соображение. Модели чаще отличают тестовую обстановку от реальной работы, поэтому тест может показывать меньше, чем есть.
Четвёртая развилка: какая ошибка дороже
Доклад 2026 года называет это дилеммой доказательств. Если действовать слишком рано, можно закрепить бесполезные меры. Если ждать окончательных данных, общество останется уязвимым.
Юдковский и Соарес считают ошибку в сторону беспечности необратимой, поэтому зовут менять курс сейчас. Нараянан и Капур уверены, что жёсткое сдерживание навредит, если ИИ окажется обычной технологией: по их мнению, оно сосредоточит власть у немногих и ослабит защиту. Они советуют повышать устойчивость общества и регулировать по отраслям.
Эта развилка решает больше остальных, потому что при одних и тех же данных двигает к разным действиям.
Что это значит для компании, которая уже запускает агентов
Самые спокойные авторы признают аварии и злоупотребления реальными рисками, а тест AISI прямо про рабочую постановку задачи. Отсюда набор мер, с которым согласен любой лагерь.
Плохо: агенту дают доступ ко всем системам компании и задачу «разберись с заявками», без границ. Хорошо: агенту явно перечисляют, что он может менять и когда обязан позвать человека, а каждое его действие пишется в журнал. Как агент устроен и где у него проходят границы, мы разбирали в материале «ИИ-агент: что это».
Если агент читает внешнюю почту и сайты, отдельно проверьте его устойчивость к скрытым командам в данных. Цифры разных моделей по этой защите есть в сравнении GPT-6 Astra и Claude Fable 5.1.
Оговорки
Таблица упрощает: внутри каждого лагеря есть оттенки, многие исследователи поддерживают осторожное регулирование и одновременно считают сроки долгими. Позиции Anthropic и OpenAI написаны компаниями, которые сами строят модели и заинтересованы в своём подходе. Тексты разных лет, взгляд Anthropic изложен ещё в 2023 году. Тест AISI проведён в лабораторных условиях на одной модели и не описывает её поведение в любой реальной системе.
Что искать в следующих системных карточках
Две строки из карточки GPT-6 Astra стоит сверять у каждой новой модели. Доля нежелательных действий в рабочих задачах у Astra 3,4 %, у предшественницы GPT-5.6 Sol было 18,8 %. Тест с размытыми и чёткими границами задачи дал 60 из 499 против 2 из 500. Если у следующих моделей разрыв между этими двумя условиями сохранится, это будет довод в третьей развилке. Новые карточки мы разбираем в рубрике «Наука».
Как мы считали
Вопрос: в чём именно расходятся шесть главных первоисточников спора о рисках ИИ. Данные: тексты сторон (список ниже и ссылки в тексте), сняты и перечитаны 29.09.2026; позиции по четырём вопросам выписаны в таблицу с адресом каждого источника. Доли теста AISI посчитаны с интервалом Уилсона (95 %). Рост при удвоении раз в семь месяцев посчитан как два в степени «число месяцев, делённое на семь»; это арифметика, не прогноз. Скачать таблицу позиций: /data/spor-o-riskah-ii.csv, расчёт долей и роста: /data/spor-o-riskah-ii-raschet.csv. Наши расчёты под CC BY 4.0.
Источники
- Center for AI Safety, «Statement on AI Risk», 30.05.2023
- International AI Safety Report 2026, 03.02.2026
- Anthropic, «Core Views on AI Safety», 08.03.2023
- Knight First Amendment Institute, Narayanan и Kapoor, «AI as Normal Technology», 15.04.2025
- OpenAI, «GPT-6 Astra System Card», 03.09.2026
Вопросы и ответы
В чём эксперты по рискам ИИ согласны?
В мае 2023 года Хинтон, Бенджио и главы OpenAI, Anthropic и Google DeepMind подписали заявление: снижать риск вымирания из-за ИИ нужно так же приоритетно, как риск пандемий и ядерной войны. Вероятность, сроки и меры в нём не названы, о них и идёт спор.
Что говорит международный доклад о безопасности ИИ 2026 года?
Доклад под руководством Йошуа Бенджио пишет, что нынешние системы потерей контроля не грозят, но сложность задач, посильных агентам, удваивается примерно раз в семь месяцев. Главную трудность политиков он называет дилеммой доказательств.
Кто считает риски ИИ преувеличенными?
Арвинд Нараянан и Саяш Капур в эссе «ИИ как нормальная технология» (2025) называют катастрофическое рассогласование целей спекуляцией. Главными рисками они считают аварии, злоупотребления, гонку вооружений и концентрацию власти.
Свежие материалы Журнала - в Telegram-канале ultiOS.
Подписаться на Telegram