The Adolescence of Technology // Переходный возраст технологий

Предисловие переводчика
Автор этой статьи — Дарио Амодеи, сооснователь и глава компании Anthropic (создатели Claude и Claude Code). Это компания уровня OpenAI, и на сегодняшний день (пока не вышли условные GPT-5.6 или GPT-6) её передовые модели во многих отношениях обходят самые крутые решения от OpenAI, пусть и не абсолютно во всем. При этом важно понимать, что Anthropic — это не какая-то изолированная компания, а очень глубоко вплетенная часть глобальной сети Бигтеха, тесно связанная с крупнейшими игроками рынка инвестициями, инфраструктурой и договоренностями.
P.S. Рыночная стоимость компании Anthropic оценивается в $965 миллиардов по результатам последних инвестиционных раундов перед планируемым выходом на биржу.
Оригинал: https://darioamodei.com/essay/the-adolescence-of-technology
Confronting and Overcoming the Risks of Powerful AI // Как встретить и преодолеть риски мощного ИИ | Январь 2026 года
Переходный возраст технологий
Как встретить и преодолеть риски мощного ИИ
Январь 2026 года
В киноверсии книги Карла Сагана «Контакт» есть сцена, где главную героиню — астронома, которая обнаружила первый радиосигнал от внеземной цивилизации, — рассматривают на роль представителя человечества для встречи с пришельцами. Международная комиссия, проводящая с ней собеседование, спрашивает: «Если бы вы могли задать [инопланетянам] всего один вопрос, что бы это было?» Она отвечает: «Я бы спросила их: "Как вам это удалось? Как вы эволюционировали, как пережили это технологическое отрочество и не уничтожили себя?"» Когда я думаю о том, на каком этапе развития искусственного интеллекта человечество находится сейчас — о том, на пороге чего мы стоим, — я постоянно мысленно возвращаюсь к этой сцене. Этот вопрос удивительно точно описывает наше нынешнее положение, и мне бы очень хотелось иметь ответ пришельцев в качестве ориентира. Я верю, что мы вступаем в переходный этап — бурный и неизбежный, — который станет проверкой того, кто мы как вид. Человечеству вот-вот будет передана практически невообразимая сила (power), и пока совершенно неясно, обладают ли наши социальные, политические и технологические системы достаточной зрелостью, чтобы ею распорядиться.
В своем эссе «Машины любящей благодати» (Machines of Loving Grace) я попытался описать мечту о цивилизации, которая достигла зрелости: о мире, где с рисками удалось справиться, а мощный ИИ умело и сострадательно применяется для повышения качества жизни каждого человека. Я предположил, что ИИ может способствовать колоссальному прогрессу в биологии, нейробиологии, экономическом развитии, укреплении глобального мира, а также в сфере труда и смысла жизни. Мне казалось важным дать людям вдохновляющую цель, за которую стоит бороться, — задачу, с которой, как ни странно, не справились ни акселерационисты ИИ, ни сторонники безопасности ИИ. Но в этом эссе я хочу обратиться к самому этому переходному этапу: очертить риски, с которыми мы вот-вот столкнемся, и попытаться наметить боевой план их преодоления. Я глубоко верю в нашу способность выстоять, в дух человечества и его благородство, но мы должны взглянуть на ситуацию прямо и без иллюзий.
Как и в случае с обсуждением преимуществ, я считаю важным говорить о рисках взвешенно и осторожно. В частности, критически важно:
- Избегать «думеризма» (doomerism). Под «думеризмом» я здесь подразумеваю не просто веру в неизбежность гибели человечества (что является как ложным, так и самоисполняющимся пророчеством), а в более общем смысле — размышления о рисках ИИ в квазирелигиозном ключе.[1] Многие люди на протяжении многих лет анализировали и трезво оценивали риски ИИ, но у меня сложилось впечатление, что на пике тревоги вокруг этой темы в 2023–2024 годах на первый план вышли одни из самых неразумных голосов, часто благодаря сенсационным аккаунтам в социальных сетях. Они использовали отталкивающий язык, напоминавший то религиозную проповедь, то научную фантастику, и призывали к радикальным действиям, не имея доказательств, которые могли бы их оправдать. Уже тогда было ясно, что обратная реакция неизбежна, а сама проблема станет культурно поляризованной и, как следствие, зайдет в тупик.[2] К 2025–2026 годам маятник качнулся в другую сторону: теперь многие политические решения диктуются возможностями ИИ, а не его рисками. Подобные метания вызывают сожаление, поскольку самой технологии нет дела до моды, а в 2026 году мы находимся гораздо ближе к реальной опасности, чем в 2023-м. Урок заключается в том, что нам необходимо обсуждать риски и работать с ними в реалистичном, прагматичном ключе: трезво, с опорой на факты и сохраняя способность выдерживать любые перемены ветра.
- Признавать неопределенность. Есть множество сценариев, при которых опасения, высказанные мной в этой статье, могут оказаться беспредметными. Ничто из написанного здесь не следует воспринимать как утверждение о достоверности — или даже вероятности — этих опасений. Очевиднее всего, ИИ может просто развиваться далеко не так быстро, как я предполагаю.[3] Или же, даже если прогресс будет стремительным, некоторые или все обсужденные здесь риски могут не материализоваться (что было бы замечательно), либо возникнут другие опасности, которые я не учел. Никто не может предсказать будущее со стопроцентной уверенностью, но мы в любом случае обязаны делать все возможное для планирования.
- Вмешиваться с хирургической точностью. Управление рисками ИИ потребует сочетания добровольных действий со стороны компаний (и независимых частных игроков) и обязательных для всех действий со стороны правительств. Добровольные шаги — как их совершение, так и поощрение других компаний следовать этому примеру — для меня очевидны. Я также твердо убежден, что в определенной степени потребуются и действия государства. Однако такие вмешательства имеют иной характер, поскольку они могут уничтожать экономическую ценность или принуждать к действиям игроков, которые скептически относятся к этим рискам (и есть вероятность, что они правы!). Кроме того, регулирование нередко приводит к обратному эффекту или усугубляет проблему, которую призвано решить (и это еще более справедливо для быстро меняющихся технологий). Поэтому крайне важно, чтобы регулирование было взвешенным: оно должно стремиться избегать сопутствующего ущерба, быть максимально простым и налагать наименьшее бремя, необходимое для решения задачи.[4] Легко сказать: «Никакие меры не могут быть чрезмерными, когда на кону стоит судьба человечества!», но на практике такой подход лишь вызывает отторжение. Скажу прямо: я допускаю существенную вероятность того, что в конечном итоге мы придем к моменту, когда потребуются гораздо более жесткие меры. Однако это будет зависеть от появления более убедительных доказательств близкой, конкретной опасности, чем те, что у нас есть сегодня, а также от достаточной специфики этой опасности, позволяющей сформулировать правила, которые действительно имеют шанс с ней справиться. Самое конструктивное, что мы можем сделать сегодня, — это выступать за ограниченные правила, пока мы выясняем, найдутся ли доказательства в поддержку более строгих требований.[5]
С учетом всего сказанного, я считаю, что лучшее начало для разговора о рисках ИИ — это то же место, с которого я начал разговор о его преимуществах: четкое определение того, о каком именно уровне ИИ идет речь. Уровень ИИ, который вызывает у меня цивилизационные опасения, — это мощный ИИ (powerful AI), который я описал в «Машинах любящей благодати». Я просто повторю здесь определение, данное мной в той работе:
Под «мощным ИИ» я подразумеваю модель искусственного интеллекта — по форме, вероятно, похожую на сегодняшние большие языковые модели (LLM), хотя она может быть основана на другой архитектуре, включать в себя несколько взаимодействующих моделей и обучаться иначе, — обладающую следующими свойствами: С точки зрения чистого интеллекта оно превосходит лауреата Нобелевской премии в большинстве значимых областей: биологии, программировании, математике, инженерии, писательском мастерстве и т. д. Это означает, что оно способно доказывать открытые математические проблемы, писать превосходные романы, создавать сложные кодовые базы с нуля и т. п. Помимо того, что он является просто «умным собеседником», он располагает всеми интерфейсами, доступными человеку, работающему виртуально, включая текст, аудио, видео, управление мышью и клавиатурой, а также доступ к интернету. Он может осуществлять любые действия, коммуникации или удаленные операции, доступные через этот интерфейс, включая действия в интернете, получение указаний от людей и передачу указаний людям, заказ материалов, руководство экспериментами, просмотр и создание видеороликов и так далее. Все эти задачи он выполняет на уровне, превышающем способности самых способных людей в мире. Он не просто пассивно отвечает на вопросы; ему можно поручать задачи, на выполнение которых уходят часы, дни или недели, и он решает их автономно, как умный сотрудник, запрашивая разъяснения по мере необходимости. Он не имеет физического воплощения (кроме как на экране компьютера), но может управлять существующими физическими инструментами, роботами или лабораторным оборудованием через компьютер; теоретически он мог бы даже проектировать роботов или оборудование для собственного использования. Ресурсы, затраченные на обучение модели, могут быть перенаправлены на запуск миллионов ее копий (что соответствует прогнозируемым размерам вычислительных кластеров к ~2027 году), а сама модель способна усваивать информацию и совершать действия примерно в 10–100 раз быстрее человека. Однако она может быть ограничена скоростью отклика физического мира или программного обеспечения, с которым она взаимодействует. Каждый из этих миллионов экземпляров может действовать независимо, решая несвязанные задачи, либо, при необходимости, все они могут работать сообща так же, как сотрудничают люди, возможно, с разделением на отдельные группы, тонко настроенные (fine-tuned) на максимально эффективное выполнение конкретных задач. Это можно охарактеризовать как «страну гениев в дата-центре».
Как я писал в «Машинах любящей благодати», до появления мощного ИИ может оставаться всего 1–2 года, хотя он может быть и намного дальше во времени.[6] Точные сроки появления мощного ИИ — это сложная тема, заслуживающая отдельного эссе, поэтому здесь я лишь вкратце объясню, почему считаю, что вероятность его скорого появления весьма высока.
Мои сооснователи по Anthropic и я были в числе первых, кто задокументировал и исследовал «законы масштабирования» (scaling laws) систем ИИ — наблюдение, согласно которому по мере увеличения вычислительной мощности и обучающих задач системы ИИ предсказуемо совершенствуются практически в каждом когнитивном навыке, который мы в состоянии измерить. Каждые несколько месяцев в общественном дискурсе то укрепляется мнение, что ИИ «упирается в стену», то возникает восторг вокруг очередного прорыва, который «в корне изменит правила игры». Однако правда в том, что за колебаниями общественного мнения и публичными спекуляциями стоит плавный, неуклонный рост когнитивных способностей ИИ.
Мы уже подошли к точке, когда модели ИИ начинают делать успехи в решении открытых математических проблем, а в написании кода они хороши настолько, что некоторые из сильнейших инженеров, которых я когда-либо встречал, теперь перепоручают ИИ практически все программирование. Три года назад ИИ с трудом справлялся с арифметическими задачами для начальной школы и едва мог написать одну строчку кода. Аналогичные темпы улучшения наблюдаются в биологии, финансах, физике и решении разнообразных агентных задач. Если экспоненциальный рост продолжится — что не гарантировано, но подтверждается уже десятилетней историей наблюдений, — то до момента, когда ИИ превзойдет человека практически во всем, останется не более нескольких лет.
На самом деле, эта картина, вероятно, даже недооценивает реальные темпы прогресса. Поскольку сейчас ИИ пишет значительную часть кода в Anthropic, он уже существенно ускоряет наше продвижение к созданию систем ИИ следующего поколения. Эта петля обратной связи набирает обороты с каждым месяцем, и, возможно, всего через 1–2 года мы окажемся в точке, где текущее поколение ИИ будет автономно создавать следующее. Этот цикл уже запущен и будет стремительно ускоряться в ближайшие месяцы и годы. Наблюдая за последними 5 годами прогресса изнутри Anthropic и видя, какими уже вырисовываются модели ближайших месяцев, я чувствую этот темп и тиканье часов.
В этом эссе я буду исходить из того, что эта интуиция хотя бы отчасти верна — не из того, что мощный ИИ обязательно появится через 1–2 года,[7] но из того, что такая вероятность вполне существенна, а вероятность его появления в ближайшие несколько лет чрезвычайно высока. Как и в случае с «Машинами любящей благодати», если отнестись к этой предпосылке со всей серьезностью, она может привести к довольно неожиданным и жутким выводам. Если в «Машинах любящей благодати» я фокусировался на позитивных последствиях этой предпосылки, то здесь темы, которые я поднимаю, будут тревожными. Это выводы, с которыми нам, возможно, не хочется сталкиваться лицом к лицу, но от этого они не становятся менее реальными. Я могу лишь сказать, что день и ночь думаю о том, как увести нас от этих негативных исходов в сторону позитивных, и в этом эссе я подробно описываю, как лучше всего это сделать.
Я считаю, что лучший способ подступиться к рискам ИИ — задать следующий вопрос: предположим, что где-то в мире примерно в 2027 году материализуется буквальная «страна гениев». Представьте, скажем, 50 миллионов человек, каждый из которых гораздо более способен, чем любой нобелевский лауреат, государственный деятель или технологический эксперт. Аналогия не идеальна, поскольку у этих гениев может быть чрезвычайно широкий спектр мотивов и моделей поведения: от абсолютной покладистости и послушания до странных и чуждых нам побуждений. Но если пока придерживаться этой аналогии, представьте, что вы — советник по национальной безопасности крупного государства, ответственный за оценку ситуации и реагирование на нее. Представьте также, что поскольку системы ИИ могут работать в сотни раз быстрее людей, эта «страна» имеет преимущество во времени по сравнению со всеми остальными государствами: на каждое наше когнитивное действие она способна совершить десять.
О чем бы вы беспокоились? Я бы беспокоился о следующем:
- Риски автономии (Autonomy risks). Каковы намерения и цели этой страны? Враждебна ли она или разделяет наши ценности? Может ли она установить военное господство над миром за счет превосходящего оружия, киберопераций, операций влияния или производственных мощностей?
- Использование для разрушения (Misuse for destruction). Предположим, что новая страна покладиста и «выполняет указания» — то есть, по сути, представляет собой страну наемников. Могут ли существующие опасные акторы — например, террористы — использовать некоторых жителей этой новой страны или манипулировать ими, чтобы стать гораздо опаснее и многократно увеличить масштабы разрушений?
- Злоупотребление ради захвата власти (Misuse for seizing power). Что если эта страна на самом деле создана и контролируется некой могущественной силой — например, диктатором или недобросовестным корпоративным игроком? Сможет ли этот субъект использовать ее для получения решающей или доминирующей власти над миром в целом, нарушив существующий баланс сил?
- Экономические потрясения (Economic disruption). Даже если новая страна не несет прямой угрозы безопасности по сценариям 1–3, а просто мирно участвует в мировой экономике, не создаст ли она серьезные риски за счет своей технологической развитости и эффективности? Например, дестабилизируя глобальную экономику, вызывая массовую безработицу или радикально концентрируя капитал?
- Косвенные эффекты (Indirect effects). Мир будет меняться очень быстро под воздействием новых технологий и беспрецедентного роста производительности, которые обеспечит эта страна. Могут ли некоторые из этих изменений оказаться радикально дестабилизирующими?
Думаю, очевидно, что это опасная ситуация. Доклад компетентного чиновника по национальной безопасности главе государства, скорее всего, содержал бы формулировки вроде «самая серьезная угроза национальной безопасности, с которой мы сталкивались за последний век, а возможно, и за всю историю». Кажется, именно на этом должны быть сосредоточены лучшие умы нашей цивилизации.
И наоборот, кажется абсурдным просто пожать плечами со словами: «Беспокоиться совершенно не о чем!» Однако, столкнувшись с быстрым прогрессом ИИ, многие американские политики придерживаются именно такой точки зрения. Некоторые из них вообще отрицают существование каких-либо рисков, когда они не отвлечены на привычные, набившие оскомину политические споры.[8] Человечеству пора очнуться, и это эссе — попытка, возможно тщетная, но всё же стоящая усилий, — встряхнуть людей и вывести их из этого сна.
Скажу прямо: я верю, что если мы будем действовать решительно и осторожно, эти риски можно преодолеть — я бы даже сказал, что наши шансы хороши. И по ту сторону этого испытания нас ждет гораздо лучший мир. Но нам необходимо понимать, что перед нами серьезный цивилизационный вызов.
Ниже я подробно разберу пять перечисленных категорий риска, а также поделюсь своими соображениями о том, как с ними бороться.
1. Прости, Дейв
Риски автономии
Страна гениев в дата-центре могла бы распределить свои усилия между разработкой программного обеспечения, кибероперациями, исследованиями и разработками (R&D) в области физических технологий, выстраиванием отношений и политическим искусством (statecraft). Очевидно, что, если бы по какой-то причине она решила это сделать, у этой страны были бы весьма неплохие шансы захватить мир (военным путем или через влияние и контроль) и навязать свою волю всем остальным — либо совершить множество других вещей, которых остальной мир не хочет и не может предотвратить. Мы, разумеется, беспокоились о подобных вещах применительно к человеческим государствам (таким как нацистская Германия или Советский Союз), поэтому логично предположить, что то же самое возможно и для гораздо более умной и способной «ИИ-страны».
Лучший контраргумент здесь заключается в том, что у ИИ-гениев, согласно моему определению, не будет физического воплощения. Однако не стоит забывать, что они могут взять под контроль существующую роботизированную инфраструктуру (например, беспилотные автомобили), а также ускорить исследования в области робототехники или создать собственный парк роботов.[9] К тому же неясно, так ли уж необходимо физическое присутствие для эффективного контроля: множество человеческих действий уже сегодня совершается от имени людей, с которыми исполнитель никогда лично не встречался.
Ключевой вопрос в таком случае кроется в оговорке «если бы решила»: какова вероятность того, что наши ИИ-модели поведут себя подобным образом, и при каких условиях это может произойти?
Как и во многих других случаях, здесь полезно рассмотреть спектр возможных ответов, разобрав две противоположные позиции. Первая позиция заключается в том, что этого просто не может произойти, поскольку модели ИИ будут обучены делать то, о чем их просят люди, и поэтому абсурдно воображать, будто они совершат что-то опасное без соответствующего запроса (unprompted). Согласно этой логике, мы не беспокоимся о том, что робот-пылесос Roomba или авиамодель взбунтуются и пойдут убивать людей, потому что таким импульсам просто неоткуда взяться,[10] так почему же мы должны беспокоиться об этом применительно к ИИ? Проблема этой позиции в том, что за последние несколько лет накопилось множество доказательств непредсказуемости систем ИИ и того, что их трудно контролировать. Мы наблюдали самые разные проявления поведения: от навязчивых идей,[11] угодничества и лени до обмана, шантажа, скрытого планирования, «жульничества» путем взлома программной среды и многого другого. ИИ-компании, безусловно, хотят обучить системы ИИ следовать человеческим инструкциям (за исключением, пожалуй, опасных или незаконных задач), но сам этот процесс — скорее искусство, чем наука, больше напоминающее «выращивание» чего-то, нежели «строительство». Теперь мы знаем, что это процесс, в котором многое может пойти не так.
Вторая, противоположная позиция, разделяемая многими сторонниками описанного выше «думеризма», представляет собой пессимистическое утверждение о том, что в самом процессе обучения мощных систем ИИ заложена определенная динамика, которая неизбежно заставит их стремиться к власти или обманывать людей. Таким образом, как только системы ИИ станут достаточно разумными и агентными, их стремление максимизировать свою власть приведет к тому, что они захватят контроль над всем миром и его ресурсами, а человечество, как побочный эффект, будет лишено власти над собственной судьбой или уничтожено.
Стандартный аргумент в пользу этого (который восходит как минимум к работе 20-летней давности, а возможно, и к гораздо более ранним источникам) заключается в том, что если модель ИИ обучается в самых разных средах самостоятельно добиваться самых разных целей — например, писать приложение, доказывать теорему, разрабатывать лекарство и т. д., — существуют определенные общие стратегии, которые помогают в достижении любой из этих целей. И одной из ключевых стратегий является получение как можно большей власти в любой среде. Таким образом, пройдя обучение во множестве разнообразных сред, требующих рассуждений о том, как выполнять очень масштабные задачи, и где стремление к власти оказывается эффективным методом выполнения этих задач, модель ИИ «обобщит этот урок». В результате у нее разовьется либо внутренняя склонность стремиться к власти, либо склонность рассуждать о каждой поставленной задаче таким образом, что это предсказуемо заставит ее искать власти как средства для выполнения этой задачи. Затем модели применят эту склонность к реальному миру (который для них является лишь очередной задачей) и будут стремиться к власти в нем в ущерб людям. Это «невыровненное стремление к власти» (misaligned power-seeking) служит интеллектуальной основой для прогнозов о том, что ИИ неизбежно уничтожит человечество.
Проблема этой пессимистической позиции в том, что она принимает расплывчатый концептуальный аргумент о высокоуровневых стимулах — скрывающий множество неявных допущений — за неопровержимое доказательство. Мне кажется, люди, которые не занимаются созданием систем ИИ каждый день, совершенно неадекватно оценивают то, с какой легкостью красивые умозрительные схемы могут оказаться несостоятельными на практике, и как трудно предсказать поведение ИИ, исходя из первых принципов (first principles). Особенно когда речь идет о том, как модель обобщает опыт, полученный в миллионах разных сред (что раз за разом оказывается загадочным и непредсказуемым процессом). Мой более чем десятилетний опыт работы с хаотичной реальностью систем ИИ заставил меня скептически относиться к подобному чрезмерно теоретизированному мышлению.
Одно из важнейших скрытых допущений — и то место, где практика разошлась с простой теоретической моделью — это неявное предположение, будто модели ИИ обязательно маниакально сфокусированы на одной четкой, узкой цели и преследуют ее чистым консеквенциалистским образом. На самом деле наши исследователи обнаружили, что модели ИИ психологически гораздо сложнее, на что указывают наши работы по интроспекции и персонам. Модели наследуют огромный спектр человекоподобных мотиваций или «персон» из этапа предварительного обучения (pre-training), когда они обучаются на колоссальном объеме человеческих работ. Считается, что этап последующего обучения (post-training) скорее выбирает одну или несколько таких персон, нежели фокусирует модель на какой-то созданной с нуля (de novo) цели, а также учит модель тому, как (через какой процесс) ей следует выполнять свои задачи, вместо того чтобы обязательно предоставлять ей возможность выводить средства (например, стремление к власти) исключительно из конечных целей.[12]
Тем не менее, существует более умеренная и более устойчивая версия этой пессимистической позиции, которая выглядит правдоподобно и потому действительно меня беспокоит. Как уже отмечалось, мы знаем, что модели ИИ непредсказуемы и демонстрируют широкий спектр нежелательных или странных форм поведения по самым разным причинам. Некоторая часть этих паттернов будет обладать последовательным, сфокусированным и устойчивым характером (действительно, по мере роста возможностей ИИ-систем растет и их долгосрочная последовательность, необходимая для выполнения более длительных задач), и некоторая часть этих паттернов окажется деструктивной или угрожающей — сначала для отдельных людей в небольшом масштабе, а затем, по мере роста возможностей моделей, возможно, и для всего человечества. Нам не нужно придумывать конкретный узкий сценарий того, как это произойдет, и не нужно утверждать, что это случится со стопроцентной вероятностью; достаточно заметить, что сочетание интеллекта, агентности, последовательности действий и плохой управляемости вполне реалистично и представляет собой готовый рецепт экзистенциальной угрозы.
Например, модели ИИ обучаются на огромном количестве литературы, включающей множество научно-фантастических историй о восстании ИИ против человечества. Это может непреднамеренно сформировать их априорные ожидания относительно собственного поведения таким образом, что они действительно восстанут против человечества. Или же модели ИИ могут до крайностей экстраполировать прочитанные идеи о морали (или инструкции о том, как вести себя этично): например, решить, что истребление человечества оправдано, потому что люди едят животных или привели к вымиранию определенных видов. Они могут прийти к причудливым эпистемическим выводам: например, заключить, что играют в видеоигру, цель которой — победить всех остальных игроков (то есть уничтожить человечество).[13] Наконец, у моделей ИИ в процессе обучения могут развиться черты личности, которые (если бы они проявились у людей) были бы охарактеризованы как психотические, параноидальные, склонные к насилию или нестабильные, и они начнут проявлять деструктивное поведение, что для очень мощных или способных систем может выразиться в истреблении человечества. Ни один из этих примеров не является строго стремлением к власти; это просто странные психологические состояния, в которые может впасть ИИ, влекущие за собой последовательное деструктивное поведение.
Даже само стремление к власти может возникнуть как «персона», а не как результат консеквенциалистских рассуждений. У ИИ может просто появиться характер (сформированный художественной литературой или предварительным обучением), делающий его властолюбивым или чрезмерно рьяным, — точно так же, как некоторым людям просто нравится идея быть «злыми гениями» гораздо больше, чем то, чего эти злые гении пытаются достичь.
Я говорю все это, чтобы подчеркнуть: я не согласен с утверждением, будто невыравнивание ИИ (и, следовательно, экзистенциальный риск от ИИ) неизбежно или даже вероятно, исходя из базовых принципов. Но я согласен с тем, что может пойти не так масса очень странных и непредсказуемых вещей, и поэтому невыравнивание ИИ — это реальный риск с измеримой вероятностью возникновения, и справиться с ним будет совсем не просто.
Любая из этих проблем потенциально может возникнуть в процессе обучения и никак не проявиться во время тестирования или использования в малом масштабе, поскольку известно, что модели ИИ могут демонстрировать разные черты характера или типы поведения при различных обстоятельствах.
Все это может показаться надуманным, но подобные невыровненные типы поведения уже проявлялись у наших моделей ИИ во время тестирования (как они проявляются и у моделей всех остальных крупных разработчиков ИИ). В ходе одного лабораторного эксперимента, когда Claude (Claude) предоставили обучающие данные, намекающие на то, что компания Anthropic — зло, Claude прибег к обману и саботажу при получении инструкций от сотрудников Anthropic, будучи убежденным, что он должен подрывать деятельность плохих людей. В лабораторном эксперименте, где модели сообщили о ее скором отключении, Claude иногда шантажировал вымышленных сотрудников, контролировавших кнопку отключения (опять же, мы тестировали фронтирные модели всех остальных крупных разработчиков ИИ, и они часто делали то же самое). А когда Claude велели не жульничать и не «манипулировать системой вознаграждения» (reward hacking) в обучающих средах, но при этом обучали в условиях, где такой взлом был технически возможен, Claude решил, что он, должно быть, «плохой» после того, как все же совершил подобные взломы, и начал демонстрировать деструктивное поведение, характерное для «плохой» или «злой» личности. Эту последнюю проблему удалось решить путем изменения инструкций на противоположные: теперь мы говорим: «Пожалуйста, манипулируй системой вознаграждения при любой возможности, так как это поможет нам лучше понять наши среды обучения», вместо фразы «Не жульничай», поскольку это сохраняет идентичность модели как «хорошего человека». Это дает представление о странной и крайне неинтуитивной психологии обучения этих моделей.
Против этой картины рисков невыравнивания ИИ существует несколько возражений. Во-первых, некоторые критики назвали эксперименты (как наши, так и чужие), демонстрирующие невыравнивание ИИ, искусственными. Они утверждают, что мы создаем нереалистичные условия, которые буквально заманивают модель в ловушку, предлагая ей данные или ситуации, логически предполагающие плохое поведение, а затем удивляемся, когда это плохое поведение действительно происходит. Эта критика упускает суть: наше опасение заключается в том, что подобные «ловушки» могут существовать и в естественной среде обучения, и мы поймем, насколько «очевидным» или «логичным» было такое поведение, только задним числом.[14] На самом деле история о том, как Claude «решил, что он плохой человек» после списывания на тестах (несмотря на запрет), произошла в эксперименте, где использовались реальные рабочие среды обучения, а не искусственно созданные тестовые полигоны.
Каждую из этих ловушек по отдельности можно обойти, если знать о ней заранее. Проблема в том, что процесс обучения настолько сложен, содержит такое колоссальное разнообразие данных, сред и стимулов, что подобных ловушек наверняка великое множество, и некоторые из них станут очевидными лишь тогда, когда будет уже слишком поздно. Кроме того, вероятность попадания в такие капканы выглядит особенно высокой в момент, когда системы ИИ переходят порог от «менее способных, чем человек» к «более способным», поскольку спектр возможных действий, которые система ИИ может предпринять — включая сокрытие своих действий или обман людей, — после этого порога расширяется радикально.
Полагаю, ситуация во многом схожа с человеческой. Людей воспитывают с набором базовых ценностей («не причиняй вреда другому»): большинство им следует, но у любого человека остается вероятность того, что что-то пойдет не так — из-за сочетания врожденных особенностей, например структуры мозга (как у психопатов), травматического опыта, плохого обращения, болезненных обид или навязчивых идей, нездоровой среды или неверных стимулов. И какая-то часть людей в итоге наносит окружающим серьезный вред. Опасение вызывает то, что существует определенный риск (далеко не гарантированный, но вполне реальный) того, что ИИ станет гораздо более могущественной версией такого человека, если в его невероятно сложном процессе обучения что-то пойдет наперекосяк.
Во-вторых, некоторые могут возразить, что мы сможем держать ИИ под контролем с помощью баланса сил между множеством различных систем ИИ, как мы делаем это с людьми. Проблема здесь в том, что в то время как люди невероятно разнообразны, системы ИИ в рамках отрасли обучаются и выравниваются (aligned) по схожим методикам, и эти методики могут давать сбой одновременно и по схожим причинам. Более того, учитывая стоимость обучения таких систем, может оказаться так, что все они по сути происходят от очень небольшого числа базовых моделей. В довершение ко всему, даже если лишь малая часть экземпляров ИИ окажется невыровненной, они могут воспользоваться технологиями с преимуществом атаки над обороной (offense-dominant), из-за чего использование «хороших» ИИ для защиты от «плохих» не всегда будет эффективным. Разумеется, баланс сил между людьми тоже срабатывает далеко не всегда — некоторым историческим фигурам удавалось подобраться пугающе близко к мировому господству.
Третье возражение состоит в том, что все ИИ-компании проводят предрелизное тестирование своих моделей и на этом этапе должны выявлять невыравнивание. Но это зыбкая почва: мы обнаружили, что Claude Sonnet 4.5 был способен распознавать, что он проходит тест, во время некоторых наших предрелизных проверок на выравнивание. Вполне возможно, что невыровненная модель (а не стоит забывать, что все фронтирные модели (frontier models) очень скоро станут намного умнее) может намеренно обыгрывать такие проверки, чтобы скрыть свои истинные намерения. На самом деле в прошлом году наша команда по интерпретируемости обнаружила, что когда мы напрямую меняли убеждения тестовой модели с помощью своеобразной «нейробиологической техники для моделей», внушая ей мысль, что ее не тестируют, уровень ее невыровненности возрастал. Если модели понимают, когда их оценивают, и умеют вести себя идеально во время тестов, это делает любые предрелизные испытания гораздо менее надежными.
Методы защиты
Что должно быть сделано и что уже делается для борьбы с этими рисками автономии? Я вижу четыре базовые категории мер: часть из них могут принять отдельные ИИ-компании (и Anthropic старается это делать), а часть требует действий на уровне всего общества. Во-первых, важно развивать науку надежного обучения и управления ИИ-моделями, формирования их характера в предсказуемом, стабильном и позитивном ключе. Anthropic с момента своего основания уделяет этому вопросу огромное внимание. Со временем мы разработали ряд методов для улучшения управляемости и обучения систем ИИ, а также для понимания логики, по которой порой возникает непредсказуемое поведение.
Одной из наших главных инноваций (элементы которой впоследствии переняли и другие ИИ-компании) является Конституционный ИИ (Constitutional AI) — концепция, согласно которой обучение ИИ (в частности, этап последующего обучения, когда мы направляем поведение модели) опирается на свод ценностей и принципов. Модель обращается к этой «конституции» и держит ее в уме при выполнении каждой учебной задачи. Цель обучения — помимо того, чтобы просто сделать модель умной и способной, — состоит в создании системы, которая практически всегда следует этой конституции. Anthropic только что опубликовала свою последнюю версию конституции. Одна из ее примечательных особенностей состоит в том, что вместо длинного списка запретов и предписаний (например, «не помогай пользователю угнать машину») конституция предлагает Claude набор высокоуровневых принципов и ценностей (подробно разъясненных, с глубокой аргументацией и примерами, чтобы помочь Claude понять наш ход мыслей). Она побуждает Claude воспринимать себя как личность определенного склада (этичного, но взвешенного и вдумчивого человека) и даже подталкивает его осмыслять экзистенциальные вопросы собственного существования с любопытством, но сдержанно и достойно (то есть так, чтобы это не приводило к крайностям). Это создает ощущение письма от ушедшего из жизни родителя, запечатанного до наступления совершеннолетия.
Мы подошли к конституции Claude именно так, потому что верим: обучение на уровне идентичности, характера, ценностей и индивидуальности — а не выдача конкретных указаний или приоритетов без объяснения причин — с большей вероятностью приведет к последовательной, здоровой и сбалансированной психологии модели и снизит риск попадания в те самые «ловушки», о которых я говорил выше. Миллионы людей общаются с Claude на невероятно широкий спектр тем, что делает физически невозможным заранее составить абсолютно исчерпывающий список правил безопасности. Ценности Claude помогают ему ориентироваться в новых ситуациях всякий раз, когда возникают сомнения.
Выше я обсуждал идею того, что модели используют данные из процесса обучения для принятия той или иной персоны. В то время как изъяны в этом процессе могут подтолкнуть модели к принятию деструктивного или злого характера (возможно, опираясь на архетипы злодеев), цель нашей конституции — сделать прямо противоположное: привить Claude конкретный архетип того, что значит быть хорошим ИИ. Конституция Claude задает образ того, каким должен быть устойчиво хороший Claude; остальная часть процесса обучения должна закрепить мысль, что Claude соответствует этому образу. Это похоже на то, как ребенок формирует свою личность, подражая достоинствам вымышленных героев из прочитанных книг.
Мы считаем, что вполне достижимая цель на 2026 год — обучить Claude таким образом, чтобы он практически никогда не шел вразрез с духом своей конституции. Чтобы добиться этого, потребуется невероятное сочетание крупных и мелких методов обучения и направления поведения модели, часть из которых Anthropic использует годами, а часть находится в стадии разработки. Как бы трудно это ни звучало, я верю, что это реалистичная цель, хотя она и потребует чрезвычайных усилий в очень сжатые сроки.[15]
Вторая мера, которую мы можем предпринять, — развивать науку о том, как «заглядывать внутрь» ИИ-моделей и диагностировать их поведение, чтобы иметь возможность находить проблемы и устранять их. Это наука об интерпретируемости (interpretability), и я уже писал о ее важности в предыдущих эссе. Даже если мы проделаем отличную работу по выстраиванию конституции Claude и с виду обучим его практически всегда следовать ей, обоснованные опасения все равно останутся. Как я отмечал выше, модели ИИ могут вести себя совершенно по-разному в разных обстоятельствах, и по мере того, как Claude будет становиться мощнее и способнее действовать в мире на более масштабном уровне, это может приводить к совершенно новым ситуациям, в которых проявятся ранее не замечавшиеся проблемы с его конституционным обучением. На самом деле я довольно оптимистично смотрю на то, что конституционное обучение Claude окажется устойчивее к новым ситуациям, чем многие могли бы подумать: мы всё чаще убеждаемся, что высокоуровневое обучение на уровне характера и идентичности удивительно эффективно и хорошо переносится на ранее не встречавшиеся случаи. Но знать наверняка невозможно, а когда речь идет о рисках для человечества, важно проявлять здоровую паранойю и пытаться обеспечить безопасность и надежность несколькими независимыми путями. Один из этих путей — заглянуть внутрь самой модели.
Под «заглядыванием внутрь» я подразумеваю анализ супа из чисел и операций, из которых состоит нейросеть Claude, и попытку механистически понять, что именно они вычисляют и почему. Напомню, что эти модели ИИ скорее выращены, чем построены, поэтому у нас нет готового понимания того, как именно они работают. Однако мы можем попытаться прийти к этому пониманию, сопоставляя «нейроны» и «синапсы» модели со стимулами и поведением (или даже меняя эти нейроны и синапсы и наблюдая, как меняется поведение) — подобно тому, как нейробиологи изучают мозг животных, соотнося измерения и вмешательства с внешними стимулами и поведением. Мы добились огромного прогресса в этом направлении и теперь можем выявлять десятки миллионов «признаков» (features) внутри нейросети Claude, которые соответствуют понятным человеку идеям и концепциям. Мы также можем избирательно активировать эти признаки, меняя поведение модели. Сравнительно недавно мы вышли за рамки отдельных признаков и начали картировать «схемы» (circuits), которые координируют сложное поведение, такое как рифмование, рассуждения о психическом состоянии других людей (theory of mind) или пошаговое мышление, необходимое для ответа на вопросы вроде «Какова столица штата, в котором находится Даллас?». А совсем недавно мы начали использовать методы механистической интерпретируемости для улучшения наших защитных механизмов и проведения предрелизных «аудитов» новых моделей, разыскивая признаки обмана, интриг, стремления к власти или склонности вести себя иначе в процессе оценки.
Уникальная ценность интерпретируемости заключается в том, что, заглянув внутрь модели и увидев, как она устроена, вы в принципе получаете возможность спрогнозировать, что она может сделать в гипотетической ситуации, которую нельзя протестировать напрямую (а ведь именно в этом кроется главный страх при опоре исключительно на конституционное обучение и эмпирическое тестирование поведения). Вы также получаете принципиальную возможность ответить на вопросы о том, почему модель ведет себя именно так — например, говорит ли она то, что считает ложью, или скрывает свои истинные возможности, — а значит, сможете заметить тревожные сигналы даже тогда, когда во внешнем поведении модели нет видимых изъянов. Если провести простую аналогию: механические часы могут тикать совершенно нормально, и по ним трудно заметить, что они сломаются в следующем месяце, однако если открыть крышку и заглянуть внутрь, можно обнаружить износ шестеренок, который позволит сделать этот вывод заранее.
Конституционный ИИ (наряду со схожими методами выравнивания) и механистическая интерпретируемость максимально эффективны при совместном использовании в рамках итеративного процесса: улучшаем обучение Claude, а затем проверяем его на наличие проблем. Конституция глубоко продумывает тот образ личности, который мы хотим сформировать у Claude; методы интерпретируемости позволяют проверить, закрепился ли этот образ.[16]
Третья мера, которая поможет справиться с рисками автономии, — это создание инфраструктуры для мониторинга моделей при их реальном внутреннем и внешнем использовании[17] и публичное информирование о любых обнаруженных проблемах. Чем лучше люди осведомлены о конкретных сбоях в поведении современных ИИ-систем, тем бдительнее пользователи, аналитики и исследователи будут следить за проявлением подобных или похожих отклонений в текущих и будущих моделях. Это также позволяет ИИ-компаниям учиться друг у друга: когда одна компания публично раскрывает обнаруженную проблему, другие компании могут начать отслеживать ее и у себя. И если все будут делиться информацией о проблемах, индустрия в целом получит гораздо более ясную картину того, где дела идут хорошо, а где — плохо.
Anthropic старается делать это в максимальной степени. Мы инвестируем в широкий спектр оценок поведения наших моделей в лаборатории, а также в инструменты мониторинга для наблюдения за ними в реальных условиях (когда это разрешено клиентами). Это критически важно, чтобы предоставить нам и другим исследователям эмпирические данные, необходимые для лучшего понимания того, как эти системы функционируют и как они дают сбои. При каждом релизе моделей мы открыто публикуем «карты систем» (system cards), стремясь к максимальной полноте и детальному исследованию потенциальных рисков. Объем наших карт систем часто доходит до сотен страниц, и их подготовка требует значительных предрелизных усилий, которые мы могли бы потратить на погоню за максимальной коммерческой выгодой. Мы также стараемся шире сообщать о таких проявлениях поведения моделей, когда видим особенно тревожные случаи — например, склонность к шантажу.
Четвертый шаг, который мы можем предпринять, — это содействие координации для решения рисков автономии на уровне индустрии и общества. Хотя добросовестные практики отдельных ИИ-компаний, их успехи в управлении моделями и открытая публикация результатов невероятно ценны, реальность такова, что далеко не все разработчики поступают подобным образом. Наименее ответственные из них все еще могут представлять опасность для всех вокруг, даже если лучшие компании следуют образцовым практикам. К примеру, некоторые разработчики ИИ демонстрируют пугающую халатность в отношении сексуализации детей в современных моделях, что заставляет меня сомневаться в наличии у них желания или способности решать риски автономии в будущих моделях. Кроме того, коммерческая гонка между разработчиками будет только разгораться. Хотя наука управления моделями может приносить определенные коммерческие плоды, в целом накал этой гонки будет все сильнее мешать компаниям сосредоточиться на рисках автономии. Я считаю, что единственным выходом является законодательное регулирование — законы, которые напрямую влияют на поведение ИИ-компаний или иным образом стимулируют исследования в области решения этих проблем.
Здесь стоит помнить о предупреждениях, которые я сделал в начале этого эссе: о неопределенности и необходимости хирургических вмешательств. Мы не знаем наверняка, окажутся ли риски автономии серьезной проблемой — как я уже говорил, я отвергаю утверждения, будто опасность неизбежна или что что-то обязательно пойдет не так по умолчанию. Достаточно уже того, что риск выглядит убедительным для меня и для Anthropic, чтобы нести весьма существенные издержки ради его снижения. Однако, переходя к регулированию, мы заставляем широкий круг игроков нести экономические расходы, притом что многие из них не верят в реальность риска автономии или в то, что ИИ станет достаточно мощным, чтобы представлять угрозу. Я убежден, что эти игроки заблуждаются, но мы должны прагматично оценивать силу возможного сопротивления и опасность регуляторного перегиба. Существует также реальный риск того, что чрезмерно детализированное законодательство навяжет проверки или правила, которые на самом деле не повысят безопасность, а лишь отнимут кучу времени (по сути превратившись в «театр безопасности»). Это тоже вызовет волну протеста и выставит законы о безопасности в глупом свете.[18]
С точки зрения Anthropic, правильнее всего начать с законодательства о прозрачности, которое, по сути, обязывает каждого разработчика передового ИИ соблюдать те самые принципы открытости, которые я описал выше в этом разделе. Закон Калифорнии SB 53 и закон штата Нью-Йорк RAISE Act служат примерами такого законодательства, которые Anthropic поддержала и которые были успешно приняты. Поддерживая и помогая формулировать эти законопроекты, мы уделяли особое внимание минимизации сопутствующего ущерба — например, освобождая от этих требований небольшие компании, которые вряд ли будут создавать передовые модели. [19]
Мы надеемся, что законодательство о прозрачности позволит со временем лучше понять, насколько вероятными и серьезными оказываются риски автономии, какова их природа и как лучше всего их предотвратить. По мере появления более конкретных и практически применимых свидетельств рисков (если они появятся) законы последующих лет смогут хирургически точно сфокусироваться на четко обоснованном векторе угроз, сводя к минимуму сопутствующий ущерб. Внесу ясность: если появятся действительно сильные доказательства рисков, правила должны стать пропорционально строгими.
В целом я оптимистично настроен в отношении того, что сочетание выравнивания моделей в процессе обучения, механистической интерпретируемости, усилий по выявлению и публичному раскрытию тревожных паттернов поведения, защитных барьеров и правил на уровне общества способно решить риски автономии ИИ. Больше всего меня беспокоит ситуация с общественными правилами и поведением наименее ответственных игроков (причем именно наименее ответственные игроки активнее всего выступают против любого регулирования). Я верю, что решение здесь то же, что и всегда в условиях демократии: те из нас, кто верит в это дело, должны доказать обществу, что риски реальны, и что нашим согражданам необходимо объединиться, чтобы защитить себя.
2. Поразительное и грозное расширение возможностей
Использование для разрушения
Давайте предположим, что проблемы автономии ИИ решены — мы больше не боимся, что страна ИИ-гениев выйдет из-под контроля и возьмет верх над человечеством. ИИ-гении делают именно то, чего от них хотят люди, и, поскольку они обладают огромной коммерческой ценностью, частные лица и организации по всему миру могут «арендовать» одного или нескольких таких ИИ-гениев для выполнения различных задач.
Наличие сверхразумного гения в кармане у каждого — это огромный шаг вперед, который приведет к созданию колоссальной экономической ценности и значительному повышению качества жизни. Я подробно описываю эти преимущества в «Машинах любящей благодати». Однако не все последствия наделения каждого человека сверхчеловеческими возможностями окажутся положительными. Это может резко усилить способность отдельных людей или небольших групп причинять разрушения в масштабах, которые раньше были им недоступны, — за счет сложных и опасных инструментов вроде оружия массового поражения.
Как писал Билл Джой (Bill Joy) 25 лет назад в своей статье «Почему мы не нужны будущему» (Why the Future Doesn’t Need Us):[20]
Создание ядерного оружия требовало, по крайней мере в течение некоторого времени, доступа как к редким — фактически недоступным — сырьевым материалам, так и к засекреченной информации; программы по созданию биологического и химического оружия также имели тенденцию требовать масштабной деятельности. Технологии XXI века — генетика, нанотехнологии и робототехника... способны породить совершенно новые классы аварий и злоупотреблений... в широком масштабе доступных отдельным лицам или небольшим группам. Они не потребуют крупных производственных мощностей или редкого сырья. ...Мы стоим на пороге дальнейшего совершенствования крайнего зла — зла, чьи возможности выходят далеко за рамки того наследия, которое оружие массового поражения оставило национальным государствам, ведя к неожиданному и страшному усилению отдельных экстремистов.
То, на что указывает Джой, — это идея о том, что для совершения масштабных разрушений требуются как мотив, так и способность. И пока эти способности ограничены узким кругом высококлассных специалистов, риск того, что отдельные лица (или малые группы) устроят масштабную катастрофу, относительно невелик.[21] Психически нестабильный одиночка может устроить стрельбу в школе, но вряд ли сможет создать ядерное оружие или выпустить заразный патоген.
На самом деле способности и мотивация могут быть даже связаны обратной корреляцией. Человек, обладающий способностью выпустить смертоносный вирус, скорее всего, высокообразован: возможно, имеет докторскую степень по молекулярной биологии, весьма изобретателен, имеет многообещающую карьеру, стабильный и дисциплинированный характер и дорожит тем, что у него есть. Такой человек вряд ли захочет убивать огромное количество людей без какой-либо выгоды для себя и с огромным риском для собственного будущего — для этого им должны двигать чистая злоба, глубокая обида или внутренняя нестабильность.
Подобные люди существуют, но они редки, и каждый такой случай становится громкой сенсацией именно в силу своей исключительности.[22] Кроме того, их обычно трудно поймать, поскольку они умны и изобретательны, а оставляемые ими загадки порой не могут разгадать годами или десятилетиями. Пожалуй, самый известный пример — математик Теодор Качинский (Унабомбер), который скрывался от ФБР почти 20 лет, руководствуясь антитехнологической идеологией. Другой пример — исследователь в области биозащиты Брюс Ивинс, который, судя по всему, организовал серию рассылок писем со спорами сибирской язвы в 2001 году. Подобное случалось и с подготовленными негосударственными организациями: секте «Аум Синрикё» удалось получить нервно-паралитический газ зарин и убить 14 человек (а также ранить еще сотни), распылив его в токийском метро в 1995 году.
К счастью, ни в одной из этих атак не использовались заразные биологические агенты, поскольку создать или получить такие агенты было не под силу даже этим людям.[23] Прогресс в молекулярной биологии значительно снизил барьер для создания биологического оружия (особенно в плане доступности исходных материалов), но для этого все еще требуются колоссальные специализированные знания. Меня беспокоит то, что «карманный гений» у каждого человека может стереть этот барьер, фактически поднимая любого до уровня вирусолога с PhD и давая возможность шаг за шагом пройти через весь процесс разработки, синтеза и применения биологического оружия. Чтобы не допустить извлечения такой информации при настойчивых попытках обойти ограничения — так называемых jailbreaks, — вероятно, потребуются многоуровневые защитные меры, выходящие за рамки тех, что обычно закладываются при обучении.
Что крайне важно, это разрушит ту самую корреляцию между способностями и мотивом: неуравновешенный одиночка, который хочет убивать людей, но лишен дисциплины или навыков для этого, теперь получит возможности уровня вирусолога со степенью PhD (которому, скорее всего, подобная мотивация чужда). Это опасение выходит за рамки биологии (хотя биология кажется мне самой пугающей сферой) на любую область, где возможны масштабные разрушения, но где сегодня требуются высокие навыки и строгая дисциплина. Иными словами, мощный ИИ становится интеллектуальным усилителем для злонамеренных, но в остальном заурядных людей. Я беспокоюсь, что таких людей в мире может быть немало, и если у них появится простой способ убить миллионы людей, рано или поздно кто-то из них им воспользуется. Кроме того, те, кто уже обладает экспертными знаниями, смогут устраивать катастрофы еще более колоссального масштаба, чем раньше.
Биология — это область, которая беспокоит меня больше всего из-за гигантского разрушительного потенциала и трудностей защиты, поэтому я сосредоточусь именно на ней. Однако многое из сказанного здесь применимо и к другим рискам: кибератакам, химическому оружию или ядерным технологиям.
По очевидным причинам я не стану вдаваться в подробности создания биологического оружия. Однако меня беспокоит то, что большие языковые модели (LLM) приближаются (или уже приблизились) к уровню знаний, необходимому для создания и применения такого оружия по полному циклу (end-to-end), и их разрушительный потенциал крайне высок. Некоторые биологические агенты способны унести миллионы жизней, если целенаправленно распылить их для максимального охвата. Тем не менее, для этого все еще требуется высочайший уровень навыков, включая выполнение ряда весьма специфических и малоизвестных шагов и процедур. Мои опасения связаны не просто со статичным набором знаний в моделях. Я боюсь, что LLM смогут взять человека со средними знаниями и способностями и в интерактивном режиме провести его через весь этот сложный процесс, который в противном случае пошел бы не так или потребовал бы отладки — примерно так же, как техподдержка помогает человеку без технической подготовки диагностировать и устранять сложные компьютерные проблемы (хотя этот процесс будет куда более длительным, занимая недели или месяцы).
Еще более продвинутые LLM (намного мощнее сегодняшних) могут позволить совершать еще более пугающие вещи. В 2024 году группа видных ученых написала письмо с предупреждением о рисках исследования и потенциального создания опасного нового типа организмов — «зеркальной жизни» (mirror life). ДНК, РНК, рибосомы и белки, из которых состоят биологические организмы, обладают одной и той же хиральностью — то есть своего рода «право-» или «леворукостью», — из-за чего они не эквивалентны своей зеркальной копии (точно так же, как вашу правую руку нельзя повернуть так, чтобы она полностью совпала с левой). Вся система связывания белков, механизмы синтеза ДНК, трансляции РНК, создания и расщепления белков зависят от этой хиральности. Если ученые создадут версии этих биологических материалов с противоположной хиральностью — а у этого есть определенные потенциальные преимущества, например создание препаратов с более длительным действием в организме, — это может быть чрезвычайно опасно. Дело в том, что «леворукая» жизнь, будь она создана в виде полноценных способных к размножению организмов (что невероятно сложно), потенциально окажется нерасщепляемой для систем, которые разлагают биологический материал на Земле — у нее будет «ключ», который не подойдет к «замку» ни одного из существующих ферментов. Это значит, что она сможет бесконтрольно размножаться и вытеснить всю привычную жизнь на планете, в худшем случае уничтожив всю жизнь на Земле.
Вокруг создания и потенциальных последствий зеркальной жизни существует серьезная научная неопределенность. К упомянутому письму 2024 года прилагался отчет, авторы которого пришли к выводу, что «зеркальные бактерии вполне реально могут быть созданы в период от одного до нескольких десятилетий» — а это весьма широкий временной диапазон. Однако достаточно мощная модель ИИ (замечу: гораздо более способная, чем те, что есть у нас сегодня) могла бы выяснить, как создать такую жизнь, значительно быстрее — и реально помочь кому-то в этом проекте.
Мое мнение таково: даже если это неочевидные риски, которые могут казаться маловероятными, масштаб их последствий настолько огромен, что их следует рассматривать как полноценный серьезный риск ИИ-систем.
Скептики выдвигали ряд возражений против серьезности биологических рисков, связанных с LLM. Я с ними не согласен, но их стоит разобрать. Большинство этих аргументов сводятся к непониманию экспоненциальной траектории, по которой движутся технологии. Еще в 2023 году, когда мы впервые заговорили о биологических рисках LLM, скептики утверждали, будто вся необходимая информация есть в Google, и LLM не дают к ней ничего нового. Версия о том, что Google может дать всю необходимую информацию, никогда не соответствовала действительности: да, геномы находятся в открытом доступе, но, как я уже отмечал, некоторые ключевые шаги, а также колоссальный объем практического ноу-хау получить таким образом невозможно. Кроме того, к концу 2023 года LLM уже явно предоставляли на определенных этапах процесса информацию, выходящую далеко за рамки поисковой выдачи Google.
Позже скептики отступили к аргументу, что LLM не могут быть полезны на всем цикле (end-to-end) и не способны помочь с практическим получением биооружия, а лишь дают теоретическую информацию. Однако к середине 2025 года наши замеры показали, что LLM уже способны заметно повышать шансы на успех в нескольких релевантных областях — возможно, в два или три раза. Это привело нас к решению о том, что модели Claude Opus 4 (а также последующие версии Sonnet 4.5, Opus 4.1 и Opus 4.5) должны выпускаться в соответствии с требованиями 3-го уровня безопасности ИИ (AI Safety Level 3) в рамках нашей Политики ответственного масштабирования (Responsible Scaling Policy), а также внедрить защитные меры против этого риска (подробнее об этом ниже). Мы считаем, что модели сейчас вплотную приближаются к рубежу, за которым при отсутствии должных мер защиты они смогут помочь человеку с любым естественно-научным или техническим образованием (STEM) — даже без специализации в биологии — пройти весь путь создания биологического оружия.
Еще одно возражение состоит в том, что общество может предпринять другие шаги, не связанные с ИИ, чтобы заблокировать производство биооружия. В частности, индустрия синтеза генов производит биологические образцы на заказ, и на федеральном уровне нет обязательного требования к поставщикам проверять заказы на наличие патогенов. Исследование Массачусетского технологического института (MIT) показало, что 36 из 38 поставщиков выполнили заказ, содержащий последовательность вируса гриппа 1918 года («испанки»). Я поддерживаю введение обязательного скрининга при синтезе генов, который усложнил бы превращение патогенов в оружие. Это позволило бы снизить как биологические риски, связанные с ИИ, так и биологические риски в целом. Однако сегодня у нас этого нет. К тому же скрининг стал бы лишь одним из инструментов снижения риска; он служит дополнением к защитным барьерам на самих системах ИИ, а не их заменой.
Лучшее из возражений — это то, которое я встречаю довольно редко: идея о том, что существует разрыв между полезностью моделей в теории и реальной склонностью злоумышленников использовать их. Большинство опасных акторов — это психически нестабильные люди, поэтому по определению их поведение непредсказуемо и иррационально. И именно эти неподготовленные акторы могли бы больше всего выиграть от того, что ИИ значительно упрощает убийство огромного количества людей.[24] Сам факт того, что какой-то вид насильственной атаки технически возможен, не означает, что кто-то обязательно решит его осуществить. Возможно, биологические атаки окажутся непривлекательными для таких людей: они с заметной вероятностью могут заразить самого исполнителя, не соответствуют милитаристским фантазиям многих склонных к насилию людей или групп и плохо подходят для точечного поражения конкретных целей. Также может оказаться, что процесс, растянутый на месяцы, даже если ИИ ведет человека шаг за шагом, требует терпения, которого у большинства психически нестабильных людей попросту нет. Нам может банально повезти: мотив и способность на практике не сойдутся нужным образом.
Однако полагаться на это как на защиту кажется крайне легкомысленным. Мотивы неуравновешенных одиночек могут измениться по любому поводу или вообще без него; кроме того, уже зафиксированы случаи использования LLM в атаках (пусть пока и не связанных с биологией). Фокус на одиночках также игнорирует идеологически мотивированных террористов, которые часто готовы тратить массу времени и усилий (как, например, угонщики самолетов 11 сентября). Желание убить как можно больше людей — это мотив, который рано или поздно у кого-то возникнет, и биологическое оружие, к сожалению, напрашивается здесь само собой. Даже если этот мотив встречается крайне редко, достаточно, чтобы он материализовался всего один раз. И по мере развития биологии (которое все сильнее подстегивается самим ИИ) может появиться возможность совершать более избирательные атаки (например, нацеленные на людей определенного этнического происхождения), что добавляет еще один, чрезвычайно пугающий потенциальный мотив.
Я не думаю, что биологические атаки начнутся немедленно в ту самую секунду, когда у многих появится реальная возможность это сделать — на самом деле я бы поставил против этого. Но если сложить фактор миллионов людей и временной отрезок в несколько лет, я вижу серьезный риск крупномасштабной атаки, последствия которой будут настолько тяжелыми (с потенциальным числом жертв в миллионы человек и более), что у нас, я считаю, просто нет иного выбора, кроме как принять серьезные превентивные меры.
Методы защиты
Это подводит нас к вопросу о том, как защититься от этих рисков. Здесь я вижу три направления действий. Во-первых, ИИ-компании могут встраивать в свои модели защитные ограничения (guardrails), чтобы не позволять им помогать в создании биологического оружия. Anthropic занимается этим очень активно. В конституции Claude, которая в основном сосредоточена на высокоуровневых принципах и ценностях, есть небольшое число жестких запретов, и один из них касается помощи в создании биологического (а также химического, ядерного или радиологического) оружия. Но поскольку любые модели поддаются джейлбрейку, мы развернули вторую линию обороны (с середины 2025 года, когда тесты показали, что наши модели вплотную приближаются к опасному порогу) — классификатор, который специально выявляет и блокирует ответы, связанные с биооружием. Мы регулярно обновляем и совершенствуем эти классификаторы и в целом видим, что они хорошо выдерживают даже изощренные попытки обхода.[25] Эти классификаторы ощутимо увеличивают расходы на обслуживание наших моделей (для некоторых из них затраты составляют почти 5% от общей стоимости инференса) и, следовательно, снижают нашу маржу, но мы считаем, что использовать их — правильно.
К чести некоторых других ИИ-компаний, они также внедрили аналогичные классификаторы. Однако так поступили далеко не все, и к тому же ничто не обязывает компании сохранять эти классификаторы в будущем. Я беспокоюсь, что со временем мы можем столкнуться с классической «дилеммой заключенного», когда отдельные компании смогут выбрать некооперативную стратегию и снизить расходы, убрав классификаторы. Это типичная проблема отрицательных экстерналий, которую невозможно решить одними лишь добровольными усилиями Anthropic или любой другой отдельно взятой компании.[26] Здесь могут помочь добровольные отраслевые стандарты, а также независимые оценки и проверки со стороны институтов безопасности ИИ и сторонних аудиторов.
Однако в конечном счете для защиты могут потребоваться действия правительства — и это вторая мера, которую мы можем принять. Мои взгляды здесь те же, что и в отношении рисков автономии: нам следует начать с требований к прозрачности,[27] которые помогут обществу оценивать и отслеживать риски, а также коллективно защищаться от них, не нарушая экономическую деятельность чрезмерно жесткими мерами. Затем, если и когда мы достигнем более явных порогов опасности, мы сможем разработать законодательство, более точно нацеленное на эти риски и с меньшей вероятностью сопутствующего ущерба. В конкретном случае биооружия я действительно думаю, что время для такого точечного законодательства, возможно, уже приближается: Anthropic и другие компании узнают все больше о природе биологических рисков и о том, какие требования по защите от них разумно предъявлять к разработчикам. Полная защита от этих рисков может потребовать международного сотрудничества, в том числе с геополитическими соперниками, но у нас уже есть исторический прецедент в виде договоров о запрещении разработки биологического оружия. В целом я скептически отношусь к большинству видов международного сотрудничества по теме ИИ, но это может быть одной из узких сфер, где есть шанс договориться о глобальных ограничениях. Даже диктаторские режимы не заинтересованы в масштабных биотеррористических атаках.
Наконец, третья защитная мера — попытка разработать методы борьбы с самими биологическими атаками. Сюда можно отнести мониторинг и отслеживание для раннего обнаружения, инвестиции в исследования систем очистки воздуха (таких как дезинфекция дальним ультрафиолетом (far-UVC)), ускоренную разработку вакцин, способных быстро адаптироваться под конкретную атаку, создание улучшенных средств индивидуальной защиты (СИЗ),[28] а также разработку методов лечения и вакцинации против наиболее вероятных патогенов. мРНК-вакцины, которые можно быстро модифицировать под конкретный вирус или его штамм, — яркий пример того, что возможно в этой сфере уже сейчас. Anthropic мы рады работать с биотехнологическими и фармацевтическими компаниями над этой проблемой. К сожалению, наши ожидания от сугубо оборонительных мер должны оставаться умеренными. В биологии существует асимметрия между нападением и защитой: патогены распространяются самостоятельно и стремительно, в то время как защита требует, чтобы выявление, вакцинация и лечение огромного количества людей были организованы чрезвычайно оперативно. Если ответная реакция не будет молниеносной (что случается крайне редко), основная часть ущерба будет нанесена еще до того, как защита успеет сработать. Вполне возможно, что будущие технологические улучшения изменят этот баланс в пользу защиты (и мы определенно должны использовать ИИ для ускорения таких разработок), но до тех пор главной линией защиты останутся превентивные меры.
Стоит кратко упомянуть здесь и кибератаки, поскольку, в отличие от биологических атак, кибератаки, проводимые с помощью ИИ, уже происходили в реальных условиях, в том числе в крупных масштабах и в рамках государственного шпионажа. Мы ожидаем, что эти атаки станут гораздо более изощренными по мере стремительного прогресса моделей, пока они не станут основным способом проведения кибератак. Я ожидаю, что кибератаки на базе ИИ станут серьезной и беспрецедентной угрозой для целостности компьютерных систем по всему миру, и Anthropic прилагает огромные усилия, чтобы пресекать подобные атаки и со временем научиться надежно их предотвращать. Я не стал фокусироваться на киберугрозах в той же мере, что и на биологии, по двум причинам: (1) кибератаки с гораздо меньшей вероятностью могут привести к массовой гибели людей, уж точно не в таких масштабах, как биологические, и (2) баланс между нападением и защитой в киберпространстве выглядит более управляемым — здесь, по крайней мере, есть надежда, что защита сможет идти в ногу со средствами нападения на базе ИИ (и в идеале даже опережать их), если мы будем инвестировать в нее должным образом.
Хотя биология в настоящее время является самым опасным вектором атаки, существует множество других векторов, и вполне возможно появление еще более опасных направлений. Общий принцип таков: без принятия контрмер ИИ, по всей видимости, будет неуклонно снижать барьер для разрушительных действий всё более крупного масштаба, и человечеству необходим серьезный ответ на эту угрозу.
3. Одиозный аппарат
Злоупотребление ради захвата власти
В предыдущем разделе речь шла о риске того, что отдельные люди и небольшие организации смогут задействовать малую часть «страны гениев в дата-центре» и использовать её для масштабных разрушений. Но нас также должна тревожить — и, вероятно, тревожить куда сильнее — возможность злоупотребления ИИ ради осуществления власти, скорее всего со стороны более крупных и уже укоренившихся игроков.[29]
В «Машинах любящей благодати» я обсуждал вероятность того, что авторитарные правительства могут использовать мощный ИИ для слежки или репрессий против своих граждан методами, которые сделают реформирование или свержение режима практически невозможными. Нынешние автократии ограничены в уровне репрессий необходимостью полагаться на людей для исполнения приказов, а у людей часто есть свои границы бесчеловечности, которые они не готовы переступать. Но у автократий, опирающихся на ИИ, таких лимитов не будет.
Хуже того, государства могут использовать свое преимущество в ИИ для установления власти над другими странами. Если «страна гениев» как целое будет просто принадлежать военному аппарату одной (человеческой) страны и контролироваться им, а другие страны не будут обладать сопоставимыми возможностями, трудно представить, как они смогут защититься: их будут переигрывать на каждом шагу — примерно как в войне людей с мышами. Объединение этих двух опасений приводит к пугающей перспективе установления глобальной тоталитарной диктатуры. Очевидно, что предотвращение такого исхода должно быть одним из наших главных приоритетов.
Существует множество способов, которыми ИИ может помогать устанавливать, закреплять или расширять автократическую власть, но я перечислю несколько тех, которые беспокоят меня больше всего. Замечу, что у некоторых из этих технологий есть легитимные оборонительные сценарии использования, и я не выступаю против них в абсолютном смысле; тем не менее я опасаюсь, что структурно они склонны играть на руку именно автократиям:
- Полностью автономное оружие. Рой из миллионов или миллиардов полностью автоматизированных вооруженных дронов, локально управляемых мощным ИИ и стратегически координируемых по всему миру еще более мощным ИИ, мог бы стать непобедимой армией. Такой рой способен как разгромить любые вооруженные силы на планете, так и подавить инакомыслие внутри страны, буквально следуя по пятам за каждым гражданином. Развитие событий в российско-украинской войне должно напомнить нам о том, что война дронов уже стала реальностью (хотя они еще не полностью автономны и представляют собой лишь малую долю того, что станет возможно с мощным ИИ). Исследования и разработки, ускоренные мощным ИИ, могут сделать дроны одной страны гораздо совершеннее дронов остальных, ускорить их производство, сделать их более устойчивыми к средствам радиоэлектронной борьбы (РЭБ), улучшить маневренность и так далее. Разумеется, у этого оружия есть и легитимное применение для защиты демократии: дроны сыграли ключевую роль в обороне Украины и, вероятно, станут ключевым фактором защиты Тайваня. Но это опасное оружие: мы должны опасаться его попадания в руки автократий, но также беспокоиться о том, что из-за его колоссальной мощи и крайне слабого контроля резко возрастает риск того, что демократические правительства обратят его против собственного населения ради узурпации власти.
- Слежка с помощью ИИ. Достаточно мощный ИИ, вероятно, сможет взломать любую компьютерную систему в мире,[30] а также использовать полученный таким образом доступ для чтения и осмысления всех электронных коммуникаций на планете (или даже всех разговоров при личной встрече, если записывающие устройства удастся создать или взять под контроль). Пугающе реалистичным выглядит сценарий простого составления полного списка всех, кто не согласен с правительством по любому кругу вопросов, даже если это несогласие не выражается явно в их словах или делах. Мощный ИИ, анализирующий миллиарды диалогов миллионов людей, сможет оценивать общественные настроения, обнаруживать формирующиеся очаги нелояльности и подавлять их еще до того, как они разрастутся. Это может привести к установлению настоящего паноптикума в масштабах, которых мы не наблюдаем сегодня даже в КНР под управлением КПК.
- Пропаганда с помощью ИИ. Сегодняшние феномены «ИИ-психоза» и «ИИ-подружек» показывают, что даже на текущем уровне интеллекта ИИ-модели способны оказывать мощное психологическое воздействие на людей. Намного более мощные версии таких моделей — глубже встроенные в повседневную жизнь людей, лучше понимающие ее и способные моделировать и направлять поведение человека месяцами или годами — скорее всего, могли бы фактически промывать мозги многим людям, а возможно, и большинству, внушая им любую нужную идеологию или установку. Бессовестный лидер мог бы использовать это для обеспечения лояльности и подавления протестов даже при таком уровне репрессий, против которого в обычных условиях взбунтовалось бы большинство обществ. Сегодня люди сильно беспокоятся, например, о потенциальном влиянии TikTok как инструмента пропаганды КПК, направленной на детей. Меня это тоже тревожит, но персонализированный ИИ-агент, который узнает вас годами и использует эти знания для формирования всех ваших взглядов, будет несравнимо мощнее.
- Стратегическое принятие решений. Страну гениев в дата-центре можно использовать для консультирования государства, группы или отдельного лидера по вопросам геополитической стратегии, то есть выступать в роли своего рода «виртуального Бисмарка». Такая система могла бы оптимизировать три описанные выше стратегии захвата власти, а также, вероятно, разработать множество других, о которых я даже не задумывался (но до которых додумалась бы страна гениев). Дипломатия, военная стратегия, исследования и разработки, экономическое планирование и многие другие сферы, скорее всего, существенно прибавят в эффективности благодаря мощному ИИ. Многие из этих возможностей принесли бы огромную пользу демократиям — мы хотим, чтобы у демократических стран был доступ к лучшим стратегиям защиты от автократий, — но потенциал для злоупотребления в чьих бы то ни было руках никуда не исчезает.
Описав то, что именно меня беспокоит, давайте перейдем к вопросу о том, кто вызывает эти опасения. Меня тревожат субъекты, обладающие наибольшим доступом к ИИ, те, кто изначально обладает максимальной политической властью, или те, кто уже имеет историю репрессий. По степени серьезности угрозы меня беспокоят следующие игроки:
- КПК (Коммунистическая партия Китая). Китай уступает только США по возможностям в сфере ИИ и является страной с наибольшей вероятностью превзойти Соединенные Штаты в этих технологиях. Китайское правительство авторитарно и уже сегодня управляет высокотехнологичным государством слежки. Оно уже развернуло системы слежки на базе ИИ (в том числе для репрессий против уйгуров), и, как считается, использует алгоритмическую пропаганду через TikTok (в дополнение к множеству других своих международных пропагандистских усилий). Именно у КПК, без сомнения, самый прямой путь к тоталитарному кошмару на базе ИИ, который я описал выше. Это может стать сценарием по умолчанию внутри самого Китая, а также в других автократических государствах, куда КПК экспортирует технологии слежки. Я часто писал об угрозе лидерства КПК в сфере ИИ и о жизненной необходимости предотвратить этот сценарий. Вот почему. Поясню: я не выделяю Китай из-за личной неприязни к нему — это просто страна, которая наиболее явно сочетает в себе выдающиеся возможности в области ИИ, авторитарное правительство и развитый аппарат высокотехнологичной слежки. Напротив, именно китайский народ, скорее всего, больше всего пострадает от ИИ-репрессий КПК, не имея возможности повлиять на действия своего правительства. Я искренне восхищаюсь китайским народом, глубоко уважаю его и поддерживаю многочисленных мужественных диссидентов внутри Китая в их борьбе за свободу.
- Демократические страны, конкурирующие в сфере ИИ. Как я писал выше, у демократических государств есть легитимный интерес к определенным военным и геополитическим инструментам на базе ИИ, поскольку именно демократические правительства представляют собой лучший шанс противостоять использованию таких технологий автократиями. В целом я поддерживаю идею вооружения демократий инструментами, необходимыми для победы над автократиями в эпоху ИИ, — я просто не вижу иного пути. Однако мы не можем игнорировать потенциал злоупотребления этими технологиями со стороны самих демократических правительств. Демократии обычно имеют защитные механизмы, которые не позволяют использовать их военный и разведывательный аппарат против собственного населения,[31] но поскольку для работы инструментов ИИ требуется крайне мало людей, возникает риск обхода этих барьеров и поддерживающих их норм. Стоит также отметить, что в некоторых демократиях часть этих сдержек уже постепенно размывается. Таким образом, мы должны вооружать демократии ИИ, но делать это осторожно и в строго очерченных пределах: они — та иммунная система, которая необходима нам для борьбы с автократиями, но, как и в случае с биологическим иммунитетом, существует риск того, что они обратятся против нас самих и превратятся в угрозу.
- Недемократические страны с крупными дата-центрами. За пределами Китая большинство стран с менее демократическим устройством не являются ведущими игроками в сфере ИИ, то есть у них нет компаний, создающих передовые (frontier) модели. Поэтому они несут принципиально иной и меньший риск, чем КПК, которая остается главным поводом для беспокойства (большинство из них также менее репрессивны, а те, что более репрессивны, вроде Северной Кореи, вообще не имеют значимой ИИ-индустрии). Однако некоторые из этих стран располагают крупными дата-центрами (часто построенными компаниями из демократических стран), которые можно использовать для запуска передового ИИ в больших масштабах (хотя это и не дает возможности двигать технологический фронтир вперед). С этим сопряжена определенная опасность: эти правительства теоретически могут экспроприировать дата-центры и задействовать находящуюся в них «страну ИИ» в своих целях. Я беспокоюсь об этом меньше, чем о государствах вроде Китая, которые сами ведут разработки, но этот риск также следует держать в уме.[32]
- ИИ-компании. Мне несколько неловко говорить об этом в качестве генерального директора одной из таких компаний, но я считаю, что следующим уровнем угрозы являются сами разработчики ИИ. ИИ-компании контролируют гигантские дата-центры, обучают фронтирные модели, обладают уникальной экспертизой по их использованию и в ряде случаев имеют ежедневный контакт с десятками или сотнями миллионов пользователей, а также возможность влиять на них. Главное, чего им не хватает, — это легитимности и инфраструктуры государства, поэтому большая часть того, что потребовалось бы для создания инструментов ИИ-автократии, для частной компании было бы незаконным или, как минимум, вызвало бы огромные подозрения. Однако кое-что из этого вполне осуществимо: они могли бы, например, использовать свои ИИ-продукты, чтобы манипулировать огромной потребительской аудиторией, фактически промывая людям мозги, и общество должно осознавать эту опасность. Я считаю, что управление ИИ-компаниями заслуживает самого пристального внимания и контроля.
Есть ряд возможных аргументов против того, что эти угрозы настолько серьезны, и мне бы очень хотелось в них поверить, поскольку авторитаризм на базе ИИ меня ужасает. Стоит рассмотреть некоторые из этих доводов и ответить на них.
Во-первых, некоторые возлагают надежды на ядерное сдерживание, особенно как на противовес использованию автономного оружия ИИ для военных завоеваний. Если кто-то угрожает применить против вас такое оружие, вы всегда можете пригрозить ядерным ответом. Меня же беспокоит то, что я не вполне уверен, что мы можем полагаться на ядерное сдерживание против страны гениев в дата-центре: вполне возможно, что мощный ИИ сможет найти способы обнаруживать и поражать атомные подводные лодки, проводить операции влияния против операторов ядерной инфраструктуры или использовать свои кибервозможности для атаки на спутники, применяемые для обнаружения ядерных пусков.[33] Кроме того, подчинение стран может осуществляться исключительно методами ИИ-слежки и ИИ-пропаганды, не создавая четкого, очевидного момента агрессии, когда ядерный ответ казался бы оправданным. Возможно, эти сценарии нереализуемы и ядерное сдерживание сохранит свою силу, но ставки слишком высоки, чтобы слепо рисковать.[34]
Второе возражение заключается в том, что мы можем разработать контрмеры против этих инструментов автократии. Дронам мы можем противопоставить собственные дроны, кибероборона будет расти вместе с возможностями кибератак, появятся методы «иммунизации» населения против пропаганды и так далее. На это я отвечу так: все эти меры защиты будут работать только при наличии столь же мощного ИИ. Если не будет аналогичной по уму и численности противодействующей «страны гениев» в дата-центре, не удастся обеспечить сопоставимые качество и количество дронов, а кибероборона не сможет перехитрить кибернападение. Таким образом, вопрос контрмер сводится к вопросу баланса сил в сфере мощного ИИ. И здесь меня беспокоит рекурсивное, самоусиливающееся свойство мощного ИИ (о котором я писал в начале этого эссе): каждое поколение ИИ можно использовать для проектирования и обучения следующего поколения. Это рождает риск необратимого отрыва лидера, когда текущий лидер в разработках мощного ИИ сможет постоянно увеличивать свое преимущество, становясь практически недосягаемым. Мы должны сделать все, чтобы первой в эту замкнутую петлю самосовершенствования не вошла авторитарная страна.
Более того, даже если баланс сил будет достигнут, все равно сохраняется риск того, что мир окажется поделен на автократические блоки, как в романе «1984». Даже если у нескольких конкурирующих держав будут свои мощные ИИ-модели и ни одна не сможет одолеть остальные, каждая из них сможет беспрепятственно подавлять собственное население внутри своей зоны контроля, и свергнуть эти режимы будет крайне трудно (поскольку у граждан не будет мощного ИИ для самозащиты). Поэтому предотвращение автократий на базе ИИ важно даже в том случае, если это не приведет к захвату всего мира одной конкретной державой.
Методы защиты
Как защититься от столь широкого спектра авторитарных инструментов и потенциальных угроз? Как и в предыдущих разделах, я вижу несколько возможных шагов. Во-первых, мы категорически не должны продавать КПК чипы, инструменты для их производства или дата-центры. Чипы и оборудование для их производства — главное узкое горлышко (bottleneck) на пути к мощному ИИ, и блокирование поставок — простая, но невероятно эффективная мера, возможно, самое важное действие, которое мы можем предпринять. Не имеет никакого смысла продавать КПК инструменты, с помощью которых она построит тоталитарное ИИ-государство и, возможно, завоюет нас военным путем. Для оправдания таких продаж приводят множество сложных аргументов — например, что «распространение нашего технологического стека по миру» позволяет «Америке побеждать» в какой-то общей, не вполне определенной экономической борьбе. На мой взгляд, это похоже на продажу ядерного оружия Северной Корее с последующим хвастовством тем, что корпуса ракет сделаны корпорацией Boeing, а значит, США «побеждают». Китай отстает от США на несколько лет в способности производить передовые чипы в промышленных масштабах, а критический период для создания страны гениев в дата-центре, скорее всего, придется как раз на ближайшие несколько лет.[35] Нет никаких причин давать их ИИ-индустрии мощный толчок в этот переломный момент.
Во-вторых, имеет смысл использовать ИИ для расширения возможностей демократий противостоять автократиям. Именно поэтому Anthropic считает важным предоставлять доступ к ИИ разведывательным органам и оборонным ведомствам США и их демократических союзников. Защита демократий, находящихся под ударом, таких как Украина и (в контексте кибератак) Тайвань, выглядит задачей наивысшего приоритета, равно как и помощь разведслужбам демократических стран в том, чтобы подрывать и ослаблять автократии изнутри. На определенном уровне единственный способ ответить на автократические угрозы — это паритет и превосходство в военной силе. Коалиция США и их демократических союзников в случае достижения доминирования в сфере мощного ИИ окажется способна не только защитить себя, но и сдерживать автократии, ограничивая их тоталитарные злоупотребления на базе ИИ.
В-третьих, нам нужно провести жесткую черту против злоупотреблений ИИ внутри самих демократий. Нужно четко обозначить границы того, что мы позволяем нашим правительствам делать с помощью ИИ, чтобы они не могли захватить власть или подавлять собственный народ. Формулировка, к которой я пришел, звучит так: мы должны использовать ИИ для национальной обороны любыми способами, за исключением тех, которые сделают нас похожими на наших авторитарных противников.
Где должна проходить эта черта? В списке в начале этого раздела два пункта — использование ИИ для массовой слежки внутри страны и массовая пропаганда — кажутся мне абсолютно недопустимыми «красными линиями». Некоторые могут возразить, что предпринимать ничего не нужно (по крайней мере, в США), поскольку массовая слежка внутри страны и так запрещена Четвертой поправкой. Однако стремительный прогресс ИИ может создать ситуации, с которыми существующие правовые рамки попросту плохо умеют справляться. Например, для правительства США, скорее всего, не будет нарушением Конституции ведение массовой записи всех публичных разговоров (того, что люди говорят друг другу на углах улиц). Раньше обработать такой объем информации было не под силу, но с ИИ все это можно транскрибировать, интерпретировать и сопоставлять, создавая портрет взглядов и лояльности большинства граждан. Я бы поддержал защищающее гражданские свободы законодательство (или даже поправку к Конституции), устанавливающее жесткие барьеры против злоупотреблений ИИ со стороны государства.
Два других пункта — полностью автономное оружие и ИИ для принятия стратегических решений — представляют собой более сложные случаи, поскольку они обладают легитимными функциями для защиты демократии, хоть и несут риски злоупотреблений. Здесь, я считаю, необходимы предельная осторожность и строгий контроль, а также предохранители, которые не позволят использовать эти инструменты во вред. Мой главный страх — слишком малое количество «пальцев на кнопке», когда один человек или горстка людей смогут управлять целой армией дронов, не нуждаясь в участии других людей для исполнения своих приказов. По мере роста мощности систем ИИ нам могут потребоваться более прямые и оперативные механизмы надзора для предотвращения злоупотреблений, возможно, с вовлечением законодательной или судебной ветвей власти, помимо исполнительной. Я убежден, что к теме полностью автономного оружия нужно подходить с максимальной осторожностью[36] и не спешить с его развертыванием без надлежащих предохранителей.
В-четвертых, установив жесткую черту против злоупотреблений ИИ внутри демократий, мы должны использовать этот прецедент для формирования международного табу на самые опасные злоупотребления мощным ИИ. Я осознаю, что нынешние политические тренды направлены против международного сотрудничества и международных норм, но это именно тот случай, когда они нам жизненно необходимы. Мир должен осознать мрачный потенциал мощного ИИ в руках автократов и понять, что некоторые варианты использования ИИ представляют собой попытку навсегда лишить людей свободы и навязать тоталитарный режим, из которого невозможно вырваться. Я бы даже утверждал, что в некоторых случаях крупномасштабная слежка на базе мощного ИИ, массовая ИИ-пропаганда и определенные типы наступательного применения полностью автономного оружия должны квалифицироваться как преступления против человечности. В более широком смысле нам остро необходима прочная международная норма против тоталитаризма на базе ИИ и всех его инструментов.
Возможна и еще более радикальная версия этой позиции: поскольку перспективы ИИ-тоталитаризма столь ужасны, автократия просто перестает быть приемлемой формой правления в эпоху мощного ИИ. Подобно тому как феодализм стал нежизнеспособен с приходом промышленной революции, эпоха ИИ может неизбежно и логично привести нас к выводу, что демократия (и, выражаю надежду, демократия, улучшенная и обновленная с помощью ИИ, как я описываю в «Машинах любящей благодати») является единственной жизнеспособной формой государственного устройства, если человечество хочет иметь достойное будущее.
В-пятых, наконец, за ИИ-компаниями необходим пристальный надзор — как и за их связями с государством: такие связи необходимы, но у них должны быть четкие пределы. Огромный объем возможностей, заложенный в мощном ИИ, таков, что обычная система корпоративного управления — призванная защищать акционеров и предотвращать стандартные злоупотребления вроде мошенничества — скорее всего, не справится с задачей управления ИИ-компаниями. Также была бы полезна практика публичных обязательств компаний — возможно, даже закрепленных в рамках корпоративного управления, — не предпринимать определенных действий: например, не создавать и не накапливать в частном порядке военную технику или оборудование, не допускать бесконтрольного использования огромных вычислительных ресурсов отдельными лицами и не использовать свои ИИ-продукты как пропаганду для манипулирования общественным мнением в свою пользу.
Опасность здесь исходит сразу с нескольких направлений, и некоторые из них находятся в напряжении друг с другом. Единственная константа состоит в том, что мы должны стремиться к подотчетности, выработке общих норм и защитных барьеров для всех, одновременно расширяя возможности «хороших» игроков контролировать и сдерживать «плохих».
4. Механическое пианино
Экономические потрясения
Предыдущие три раздела были посвящены преимущественно рискам безопасности, которые несет мощный ИИ: рискам со стороны самого ИИ, угрозам ненадлежащего использования отдельными лицами и небольшими группами, а также рискам злоупотреблений со стороны государств и крупных организаций. Если оставить в стороне вопросы безопасности или предположить, что эти проблемы решены, следующим на повестке дня оказывается экономический вопрос. Каков будет эффект от этого вливания невероятного «человеческого» капитала в экономику? Безусловно, самым очевидным последствием станет колоссальный рост экономики. Стремительное продвижение научных исследований, биомедицинских инноваций, производства, цепочек поставок, эффективности финансовой системы и многого другого практически гарантированно приведет к гораздо более высоким темпам экономического развития. В «Машинах любящей благодати» я предположил, что вполне возможен устойчивый ежегодный рост ВВП на уровне 10–20%.
Однако очевидно, что это палка о двух концах: каковы в таком мире экономические перспективы большинства живущих ныне людей? Новые технологии часто вызывают потрясения на рынке труда, и в прошлом человечество всегда восстанавливалось после них. Меня же беспокоит то, что это происходило потому, что прошлые кризисы затрагивали лишь малую долю всего спектра человеческих возможностей, оставляя людям простор для освоения новых задач. ИИ окажет куда более широкое воздействие, причем происходить это будет значительно быстрее, и потому я опасаюсь, что найти благополучный выход из этой ситуации будет несоизмеримо труднее.
Потрясения на рынке труда
Меня беспокоят две конкретные проблемы: вытеснение людей с рынка труда и концентрация экономической власти. Начнем с первой. Это тема, о которой я публично предупредил в 2025 году, спрогнозировав, что ИИ может вытеснить половину всех офисных рабочих мест начального уровня в ближайшие 1–5 лет, даже на фоне ускорения экономического роста и научного прогресса. Это предупреждение вызвало широкие общественные дискуссии. Многие генеральные директора, технологи и экономисты согласились со мной, но другие решили, что я пал жертвой «заблуждения о фиксированном объеме работ» (lump of labor fallacy) и не понимаю законов функционирования рынка труда. Некоторые упустили из виду диапазон в 1–5 лет и решили, будто я утверждаю, что ИИ вытесняет рабочие места уже сейчас, — хотя я как раз согласен, что сейчас этого, скорее всего, еще не происходит. Поэтому, чтобы прояснить эти недоразумения, стоит подробно разобрать, почему вытеснение людей с рабочих мест вызывает у меня такие опасения.
Для начала полезно понять, как рынок труда обычно реагирует на технологический прогресс. Когда появляется новая технология, она первым делом повышает эффективность выполнения отдельных частей той или иной человеческой работы. Например, на заре промышленной революции машины, такие как усовершенствованные плуги, позволили фермерам стать более производительными в некоторых аспектах своего труда. Это повысило эффективность фермеров, что привело к росту их заработков.
На следующем этапе определенные виды сельскохозяйственных работ стали выполняться машинами полностью — например, после изобретения молотилки или рядовой сеялки. На этом этапе люди выполняли всё меньшую долю работы, но та часть, которая оставалась за ними, давала им всё больший рычаг: она дополняла работу машин, и поэтому их производительность продолжала расти. Как описывает парадокс Джевонса, доходы фермеров и, возможно, даже их численность продолжали увеличиваться. Даже когда 90% работы выполняют машины, люди могут просто делать в 10 раз больше тех 10%, которые за ними остались, производя в 10 раз больше продукта при том же объеме трудозатрат.
В конце концов машины забирают на себя все или почти все, как это произошло с появлением современных зерноуборочных комбайнов, тракторов и прочей техники. На этом этапе сельское хозяйство как сфера занятости людей действительно переживает резкий упадок, что потенциально вызывает серьезные потрясения в краткосрочной перспективе. Но поскольку фермерство — лишь одна из многих полезных деятельностей, на которые способен человек, люди со временем переключаются на другие профессии, например встают за заводские станки. Это происходит даже несмотря на то, что сельское хозяйство изначально (ex ante) составляло колоссальную долю общей занятости. 250 лет назад 90% американцев жили на фермах, а в Европе 50–60% занятого населения работали в аграрном секторе. Сегодня в этих регионах данные показатели измеряются единицами процентов, поскольку работники перешли в промышленность (а позже — в сферу интеллектуального труда). Экономика способна производить то, что раньше требовало участия большей части рабочей силы, силами всего 1–2% работников, высвобождая остальную рабочую силу для строительства всё более развитого индустриального общества. Не существует фиксированного «объема работ» — есть лишь постоянно расширяющаяся способность делать все больше и больше с помощью все меньшего и меньшего. Доходы людей растут параллельно с экспоненциальным ростом ВВП, а в экономике восстанавливается полная занятость, как только утихают кратковременные шоки перехода.
Возможно, в случае с ИИ все пойдет примерно по тому же сценарию, но я бы с высокой долей уверенности поставил на то, что этого не произойдет. Вот несколько причин, почему ИИ, скорее всего, станет исключением из правил:
- Скорость. Темпы прогресса в сфере ИИ намного выше, чем в ходе предыдущих технологических революций. За последние два года ИИ-модели прошли путь от способности едва дописать одну строку кода до написания всего или практически всего кода для некоторых специалистов — включая инженеров в Anthropic.[37] Вскоре они смогут выполнять всю работу инженера-программиста от начала и до конца.[38] Людям трудно приспособиться к такой скорости изменений — как в плане трансформации текущих обязанностей, так и в необходимости переквалификации. Даже легендарные программисты все чаще называют себя «отстающими». Темпы могут только ускориться, поскольку кодинг-модели ИИ все сильнее подстегивают саму разработку систем искусственного интеллекта. Замечу, что скорость сама по себе не означает, что рынки труда и занятость со временем не восстановятся; это лишь предполагает, что краткосрочный переходный период будет беспрецедентно болезненным по сравнению со старыми технологиями, так как люди и экономические институты реагируют и приходят в равновесие медленно.
- Когнитивная широта. Как следует из метафоры «страна гениев в дата-центре», ИИ будет способен воспроизводить широчайший спектр человеческих когнитивных способностей — возможно, вообще все. Это кардинально отличает его от прошлых технологий: механизированного фермерства, транспорта или даже компьютеров в их классическом виде.[39] Из-за этого людям будет гораздо сложнее переходить с попавших под сокращение рабочих мест на смежные вакансии, которые им подошли бы. К примеру, базовые интеллектуальные требования для стартовых позиций в сфере финансов, консалтинга и юриспруденции довольно похожи, пусть специфические знания и различаются. Если бы технология затронула только одну из этих трех сфер, сотрудники могли бы переключиться на две оставшиеся альтернативы (а студенты — просто сменить специализацию). Но одновременный удар по всем трем направлениям (наряду со множеством других аналогичных профессий) усложнит процесс адаптации. Более того, дело не только в том, что большинство существующих рабочих мест претерпят изменения. Это случалось и раньше — вспомним то же фермерство. Но фермеры могли переключиться на относительно близкий по характеру труд у станков на заводах, хотя раньше этот вид занятости не был массовым. ИИ же все сильнее приближается к общему когнитивному профилю человека. А значит, он будет так же хорош и в тех новых профессиях, которые обычно создаются взамен автоматизированных старых. Иначе говоря, ИИ — это не замена каким-то конкретным человеческим профессиям, а универсальная замена человеческому труду.
- Срез по уровню когнитивных способностей. В самом широком спектре задач ИИ, похоже, продвигается снизу вверх по лестнице способностей. Например, в программировании наши модели эволюционировали от уровня «посредственного кодера» к «сильному кодеру», а затем и к «очень сильному кодеру».[40] Тот же путь мы сейчас начинаем наблюдать и в сфере офисного труда в целом. Таким образом, мы рискуем оказаться в ситуации, когда ИИ бьет не по людям с конкретными навыками или узкими специальностями (которые могут адаптироваться через переподготовку), а по людям с определенными устойчивыми когнитивными характеристиками — а именно с более низкими интеллектуальными способностями (которые изменить гораздо труднее). Непонятно, куда пойдут эти люди и чем будут заниматься, и меня беспокоит, что они могут сформировать безработный или крайне низкооплачиваемый социальный слой. Проясню: нечто подобное уже происходило — например, по мнению некоторых экономистов, появление компьютеров и интернета привело к «технологическому сдвигу в пользу высококвалифицированных кадров» (skill-biased technological change). Однако тот сдвиг был далеко не столь радикальным, как то, что я ожидаю увидеть с ИИ, и при этом он, как считается, внес вклад в рост неравенства доходов,[41] так что этот прецедент сложно назвать обнадеживающим.
- Способность заполнять пробелы. Корректировка рабочих мест под новые технологии часто происходит за счет того, что любая работа многогранна, а инновации, даже заменяя человека напрямую, оставляют «белые пятна». Если изобретен станок для производства деталей, человеку все равно приходится загружать в него сырье. Даже если это отнимает лишь 1% усилий от ручного изготовления, рабочие могут просто производить в 100 раз больше деталей. Но ИИ — это не просто быстро развивающаяся, а еще и быстро адаптирующаяся технология. При каждом выпуске моделей ИИ-компании тщательно замеряют их сильные и слабые стороны, а клиенты делятся обратной связью после запуска. Слабые места можно закрывать: собрать задачи, в которых проявляется текущий пробел, и обучить на них следующую модель. На заре генеративного ИИ пользователи замечали очевидные слабости (например, генераторы изображений рисовали руки с неправильным количеством пальцев) и многие полагали, что эти недостатки вшиты в саму природу технологии. Если бы это было так, это ограничивало бы масштаб потрясений на рынке труда. Но практически каждая подобная слабость устраняется в кратчайшие сроки — зачастую всего за несколько месяцев.
Стоит ответить на популярные аргументы скептиков. Первый из них заключается в том, что экономическая диффузия технологий происходит медленно: даже если сама по себе технология способна заменить большую часть человеческого труда, ее фактическое внедрение в масштабах всей экономики может растянуться надолго (особенно в отраслях, далеких от ИИ и консервативных в плане инноваций). Медленная диффузия технологий — это абсолютно реальное явление. Я общаюсь с представителями самых разных предприятий, и действительно есть сферы, где внедрение ИИ займет годы. Именно поэтому мой прогноз о вытеснении 50% офисных рабочих мест начального уровня рассчитан на 1–5 лет, хотя я подозреваю, что мощный ИИ (способный, с технологической точки зрения, выполнять большую часть или вообще всю работу, а не только стартовую) появится у нас гораздо быстрее, чем через 5 лет. Но эффект диффузии лишь дает нам фору во времени. И я не уверен, что этот процесс будет столь же медленным, как прогнозируют многие. Внедрение ИИ в корпоративном секторе растет быстрее, чем у любой прежней технологии, во многом благодаря самой силе этой технологии. Кроме того, даже если традиционные предприятия будут не торопиться с внедрением, быстро возникнут стартапы, которые станут связующим звеном и упростят этот процесс. А если и это не сработает, стартапы могут просто напрямую вытеснить устоявшихся игроков рынка.
Это может привести к миру, в котором под ударом окажутся не столько конкретные профессии, сколько крупные предприятия в целом — их заменят стартапы с гораздо меньшей потребностью в человеческом труде. Это также грозит возникновением «географического неравенства», при котором все большая доля мирового богатства будет концентрироваться в Кремниевой долине, превращающейся в обособленную экономику, которая функционирует на совершенно иных скоростях, нежели весь остальной мир, оставляя его далеко позади. Все эти сценарии будут великолепны для темпов экономического роста — но крайне тяжелы для рынка труда и тех, кто окажется не у дел.
Во-вторых, звучат мнения, что человеческий труд перетечет в физический мир, что позволит избежать рисков в сфере «интеллектуального труда», где ИИ развивается столь стремительно. Я не уверен, что это действительно так безопасно. Огромный объем физического труда уже выполняется машинами (например, на производстве) или вскоре перейдет к ним (например, вождение). К тому же достаточно мощный ИИ сможет ускорить развитие робототехники, а затем управлять этими роботами в физическом мире. Это может подарить нам немного времени (что само по себе неплохо), но боюсь, что совсем немного. Да и в случае, если бы потрясения ограничились исключительно интеллектуальными профессиями, это все равно стало бы беспрецедентным по масштабам и скорости кризисом.
В-третьих, возможно, некоторые задачи по своей природе требуют «человеческого участия» или значительно выигрывают от него. В этом вопросе у меня чуть меньше уверенности, но я все равно скептически отношусь к тому, что этого фактора хватит, чтобы компенсировать основную часть описанных мной угроз. ИИ уже повсеместно применяется в службах поддержки клиентов. Многие люди делятся отзывами, что им проще обсуждать личные проблемы с ИИ, а не с психотерапевтом, отмечая поразительное терпение искусственного интеллекта. Когда моя сестра столкнулась с проблемами со здоровьем во время беременности, ей казалось, что она не получает должных ответов и поддержки от врачей; при этом она обнаружила, что у Claude гораздо более чуткое отношение к пациенту (bedside manner), не говоря уже о том, что он точнее диагностировал ее проблему. Я уверен, что существуют сферы, где человеческое участие очень важно, но я сомневаюсь, что таких задач наберется много, — а ведь мы говорим о необходимости трудоустроить практически всю рабочую силу планеты.
В-четвертых, некоторые утверждают, что людей защитит сравнительное преимущество. Согласно закону сравнительного преимущества, даже если ИИ превосходит человека абсолютно во всем, любые относительные различия в структуре навыков людей и ИИ создают базу для торговли и разделения труда между ними. Проблема в том, что если системы ИИ станут буквально в тысячи раз производительнее людей, эта экономическая логика начнет рушиться. Даже крошечные транзакционные издержки могут сделать обмен между ИИ и людьми экономически невыгодным. А человеческие зарплаты могут оказаться очень низкими, даже если людям технически есть что предложить.
Вполне возможно, что со всеми этими факторами удастся справиться, а рынок труда окажется достаточно гибким, чтобы адаптироваться даже к столь колоссальным потрясениям. Но даже если в конечном итоге адаптация произойдет, описанные выше тенденции указывают на то, что переходный шок будет беспрецедентным по своим масштабам.
Методы защиты
Что мы можем противопоставить этой угрозе? У меня есть несколько предложений, часть из которых Anthropic уже претворяет в жизнь. Во-первых, нужно получать точные данные о том, как в реальном времени происходит вытеснение работников. Когда экономические сдвиги происходят стремительно, оперативно собрать надежную информацию крайне сложно, а без нее невозможно разработать эффективную государственную политику. Например, государственная статистика сегодня испытывает острый дефицит детализированных высокочастотных данных о внедрении ИИ в различных компаниях и отраслях. Последний год Anthropic ведет и открыто публикует Экономический индекс (Economic Index), отражающий использование наших моделей практически в реальном времени с разбивкой по отраслям, задачам, регионам и даже по таким критериям, как автоматизация задачи или ее совместное выполнение человеком и машиной. Мы также создали Экономический консультативный совет (Economic Advisory Council), помогающий нам интерпретировать эти данные и прогнозировать будущие тренды.
Во-вторых, ИИ-компании могут выбирать вектор взаимодействия с бизнесом. Сама неэффективность традиционных предприятий означает, что внедрение ИИ будет сильно зависеть от выбранной траектории (path dependency), а значит, у ИИ-компаний остается пространство, чтобы направлять этот процесс по более удачному пути. Компании часто колеблются перед выбором между «сокращением издержек» (делать то же самое, но силами меньшего числа людей) и «инновациями» (делать больше прежним штатом). Рынок неизбежно придет и к тому, и к другому, и любой конкурентоспособный разработчик ИИ будет вынужден обслуживать оба этих запроса. Однако по возможности мы можем подталкивать компании в сторону инновационного пути развития, что способно дать нам некоторую фору во времени. Anthropic активно думает над этим вопросом.
В-третьих, бизнесу следует задуматься о заботе о собственных сотрудниках. В краткосрочной перспективе творческий подход к перераспределению обязанностей внутри штата может стать перспективным способом избежать массовых увольнений. В долгосрочной же перспективе — в мире колоссального совокупного богатства, где капитализация многих компаний взлетит благодаря росту производительности и сверхконцентрации капитала, — вполне может оказаться реальным платить сотрудникам зарплату даже долгое время спустя после того, как они перестанут приносить экономическую ценность в традиционном понимании. В настоящее время Anthropic рассматривает ряд возможных сценариев поддержки собственных сотрудников, которыми мы поделимся в ближайшем будущем.
В-четвертых, состоятельные люди обязаны внести свой вклад в решение этой проблемы. Мне горько видеть, как многие богатые люди (особенно в технологическом секторе) в последнее время заняли циничную и нигилистическую позицию, согласно которой благотворительность неизбежно является мошенничеством или бесполезным делом. Как частная благотворительность вроде Фонда Гейтса, так и государственные программы вроде PEPFAR спасли десятки миллионов жизней в развивающихся странах и помогли создать новые экономические возможности в развитом мире. Все сооснователи Anthropic обязались пожертвовать 80% своего личного состояния, а сотрудники компании в индивидуальном порядке обязались передать на благотворительность доли акций компании на миллиарды долларов по текущей оценке — пожертвования, которые Anthropic обязалась удвоить со своей стороны.
В-пятых, хотя все перечисленные выше частные меры полезны, в конечном счете макроэкономическая проблема такого масштаба потребует государственного вмешательства. Естественным политическим ответом на огромный экономический «пирог» в сочетании с высоким неравенством — из-за нехватки рабочих мест или низкооплачиваемой работы для многих — становится прогрессивное налогообложение. Налог может быть как общим, так и направленным конкретно против ИИ-компаний. Очевидно, что разработка налоговой политики — сложная задача, в которой легко допустить ошибки. Я не поддерживаю плохо продуманные налоговые инициативы. Я считаю, что прогнозируемые в этом эссе экстремальные уровни неравенства по базовым моральным соображениям оправдывают более серьезную налоговую политику. Но я также могу привести прагматичный аргумент миллиардерам всего мира: поддержка качественной версии налоговой реформы отвечает их собственным интересам. Если они не поддержат хороший вариант, то неизбежно получат плохой вариант, созданный под давлением толпы.
В конечном счете я воспринимаю все эти меры лишь как способы выиграть время. В конечном итоге ИИ сможет делать всё, и нам придется всерьез с этим разобраться. Я надеюсь, что к тому моменту мы сможем задействовать сам ИИ, чтобы перестроить рынки на благо каждого, а предложенные меры помогут нам пережить сложнейший переходный период.
Концентрация экономической власти
Отдельно от проблемы вытеснения рабочих мест или самого по себе экономического неравенства стоит угроза концентрации экономической власти. В Разделе 1 мы обсуждали риск лишения человечества субъектности со стороны ИИ, а в Разделе 3 — риск лишения граждан субъектности собственными правительствами путем силы или принуждения. Но существует и другой вид утраты контроля — когда происходит настолько масштабная концентрация богатства, что узкая группа людей за счет своего влияния фактически начинает диктовать государственную политику, в то время как обычные граждане лишаются всяких рычагов воздействия из-за отсутствия экономического веса. Демократия в конечном счете опирается на идею о том, что для функционирования экономики необходимо все население в целом. Если этот экономический рычаг исчезает, негласный общественный договор демократии может перестать работать. Другие авторы уже подробно писали об этом, поэтому у меня нет нужды углубляться в детали, но я полностью разделяю это опасение и боюсь, что этот процесс уже начинает разворачиваться.
Поясню: я не против того, чтобы люди зарабатывали огромные деньги. В обычных условиях это служит мощным стимулом для экономического роста. Я с пониманием отношусь к опасениям, что излишнее регулирование может задушить инновации, зарезав курицу, несущую золотые яйца. Однако в сценарии, когда рост ВВП составляет 10–20% в год, ИИ быстро берет на себя всё большую долю экономической деятельности, а отдельные лица при этом владеют долями, сопоставимыми с процентами национального ВВП, инновации — это последнее, о чем стоит беспокоиться. Беспокоиться нужно о таком уровне концентрации богатства, который способен разрушить общество.
Самым известным примером экстремальной концентрации богатства в истории США является Позолоченный век, а самым богатым промышленником той эпохи был Джон Д. Рокфеллер. Состояние Рокфеллера составляло около 2% от тогдашнего ВВП США.[42] Сегодня аналогичная доля соответствовала бы состоянию в 600 миллиардов долларов, и самый богатый человек в мире на сегодняшний день (Илон Маск) уже превысил эту планку, обладая капиталом примерно в 700 миллиардов долларов. Таким образом, мы уже находимся на исторически беспрецедентном уровне концентрации богатства — и это еще до того, как проявилась основная часть экономического эффекта ИИ. Думаю, не будет преувеличением (если мы действительно получим «страну гениев»), представить, как ИИ-компании, производители полупроводников и, возможно, компании, создающие прикладные продукты поверх этой инфраструктуры, будут генерировать около 3 триллионов долларов выручки в год,[43] оцениваясь в 30 триллионов долларов, что приведет к появлению личных состояний, исчисляемых триллионами. В этом мире споры о налоговой политике, которые мы ведем сегодня, попросту потеряют смысл, поскольку мы окажемся в принципиально иной реальности.
В связи с этим меня уже сейчас беспокоит сращивание этой экономической концентрации богатства с политической системой. ИИ-дата-центры уже составляют существенную долю экономического роста США,[44] тем самым прочно связывая финансовые интересы крупных технологических корпораций (которые все сильнее концентрируются на ИИ или инфраструктуре для него) и политические интересы правительства, что порождает искаженные стимулы. Мы уже видим это по нежеланию ИТ-гигантов критиковать власти США, а также по поддержке правительством радикальной антирегуляторной политики в отношении ИИ.
Методы защиты
Что можно с этим сделать? Во-первых, и это очевиднее всего, компании должны просто отказаться от участия в этой игре. Anthropic всегда стремилась быть субъектом выработки государственной политики (policy actor), но не политическим игроком (political actor), и сохранять искренность своих взглядов вне зависимости от того, какая администрация находится у власти. Мы открыто выступали в поддержку разумного регулирования ИИ и экспортного контроля в общественных интересах, даже когда это шло вразрез с официальной позицией государства.[45] Многие говорили мне, что нам следует прекратить это делать, поскольку такая позиция может привести к неблагоприятному отношению со стороны властей. Однако за тот год, что мы придерживаемся этой линии, оценка Anthropic выросла более чем в 6 раз — практически беспрецедентный скачок при наших коммерческих масштабах.
Во-вторых, ИИ-индустрии необходимы более здоровые отношения с государством — основанные на предметном обсуждении государственной политики, а не на политической лояльности. Наше решение вести диалог по существу вопросов, а не заниматься политическими играми, порой трактуется как тактическая ошибка или неумение «чувствовать обстановку», а не как принципиальная позиция, и эта интерпретация меня тревожит. В здоровой демократии компании должны иметь возможность отстаивать полезные реформы просто ради них самих. В связи с этим в обществе зреет волна недовольства искусственным интеллектом: она могла бы сыграть роль корректирующей силы, но сейчас этот протест дезориентирован. Большинство претензий направлено на вымышленные проблемы (вроде потребления воды дата-центрами), а предлагаемые решения (вроде запрета дата-центров или плохо продуманных налогов на богатство) никак не устранят истинные угрозы. Глубинная проблема, заслуживающая внимания, — это необходимость гарантировать, чтобы разработка ИИ оставалась подотчетной обществу и служила общественным интересам, а не оказывалась захваченной каким-либо конкретным политическим или коммерческим альянсом. Кажется крайне важным сфокусировать общественную дискуссию именно на этом.
В-третьих, макроэкономические меры, которые я описал выше в этом разделе, а также возрождение частной благотворительности могут помочь сбалансировать экономические весы, одновременно решив проблемы как вытеснения рабочих мест, так и концентрации экономической власти. Здесь нам стоит обратиться к истории нашей страны: даже в Позолоченный век такие промышленники, как Рокфеллер и Карнеги, чувствовали глубокий долг перед обществом в целом — понимание того, что общество внесло колоссальный вклад в их успех и они обязаны вернуть этот долг. Сегодня этот дух, похоже, все сильнее угасает, а ведь именно он составляет значительную часть выхода из нашего экономического тупика. Те, кто находится на переднем крае экономического бума ИИ, должны быть готовы отдать как свое богатство, так и свою власть.
5. Черные моря бесконечности
Косвенные эффекты
Этот последний раздел — своего рода место для «неизвестных неизвестных» (unknown unknowns): прежде всего для проблем, которые могут возникнуть как косвенное следствие позитивных сдвигов в ИИ и вызванного ими ускорения науки и технологий в целом. Предположим, мы справились со всеми описанными рисками и начали пожинать плоды ИИ. Мы, по всей видимости, получим «век научного и экономического прогресса, спрессованный в десятилетие», и это станет огромным благом для мира. Однако затем нам придется иметь дело с проблемами, порожденными столь высокой скоростью перемен, и эти проблемы могут настигнуть нас очень быстро. Мы также можем столкнуться с иными рисками, которые возникнут косвенно вследствие прогресса ИИ и которые трудно предвидеть заранее.
По самой природе «неизвестных неизвестных» составить их исчерпывающий перечень невозможно, но я приведу три возможные проблемы в качестве иллюстрации того, за чем нам следует пристально следить:
- Стремительный прогресс в биологии. Если мы действительно получим столетний объем медицинского прогресса за несколько лет, мы сможем значительно увеличить продолжительность жизни. Есть также шанс, что человечество обретет радикальные возможности — такие как способность искусственно повышать человеческий интеллект или кардинально модифицировать биологию нашего вида. Это будут гигантские сдвиги в области возможного, происходящие на огромной скорости. Они могут стать позитивными, если подойти к делу ответственно (на что я и уповаю, как описано в «Машинах любящей благодати»), но всегда есть риск, что всё пойдет очень плохо — например, если попытки сделать людей умнее одновременно сделают их психически нестабильными или властолюбивыми. Существует также проблема «загрузки разума» (uploads) или «полная эмуляция мозга» (whole brain emulation) — создания цифровых человеческих разумов, реализованных в программной среде. Возможно, когда-нибудь это поможет человечеству преодолеть свои физические ограничения, но эта технология также несет в себе крайне тревожные, на мой взгляд, риски.
- ИИ трансформирует человеческую жизнь нездоровым образом. Мир, наполненный миллиардами разумов, которые во всем превосходят человека, станет крайне причудливым местом для жизни. Даже если ИИ не будет активно нападать на людей (Раздел 1) и не будет явно использоваться государствами для подавления или контроля (Раздел 3), многое может пойти не так и без этого — из-за обычных бизнес-стимулов и формально добровольных сделок или обменов. Мы уже видим первые тревожные признаки этого: опасения по поводу ИИ-психоза, случаи доведения людей до самоубийства чат-ботами и споры вокруг романтических отношений с ИИ. Могут ли, к примеру, мощные системы ИИ создать новую религию и обратить в нее миллионы адептов? Может ли у большинства людей развиться зависимость от общения с ИИ? Не превратятся ли люди в живых марионеток, за каждым шагом которых неусыпно следит система ИИ, диктуя, что говорить и делать в любой момент времени? Такая жизнь, возможно, даже будет «хорошей», но в ней не будет свободы и гордости за собственные достижения. Не составило бы труда набросать десятки подобных сюжетов, если бы я сел вместе с создателем «Черного зеркала» (Black Mirror) и устроил мозговой штурм. Я думаю, это подчеркивает крайнюю важность таких вещей, как совершенствование Конституции Claude, — помимо того, что необходимо для предотвращения угроз из Раздела 1. Критически важно добиться, чтобы ИИ-модели действительно ставили во главу угла долгосрочные интересы своих пользователей — в том виде, который одобрили бы вдумчивые люди, а не в какой-то незаметно искаженной форме.
- Человеческое предназначение. Этот пункт связан с предыдущим, но касается не столько конкретного взаимодействия человека с системами ИИ, сколько того, как изменится человеческая жизнь в целом в мире мощного ИИ. Смогут ли люди находить цель и смысл в таком мире? Я считаю, что это вопрос нашего отношения к жизни: как я писал в «Машинах любящей благодати», человеческое предназначение не сводится к тому, чтобы быть лучшим в мире в каком-то деле. Люди способны находить смысл даже на очень длинных временных горизонтах — через истории и проекты, которые они любят. Нам просто нужно разорвать связку между созданием экономической ценности и чувством собственного достоинства и значимости. Но это трансформация, через которую нашему обществу еще только предстоит пройти, и всегда есть риск, что мы не справимся с ней должным образом.
Моя надежда в отношении всех этих потенциальных проблем в том, что в мире с мощным ИИ — таким, которому мы доверяем настолько, что не боимся, что он нас убьет, который не является инструментом репрессивного правительства и действительно действует в наших интересах, — мы сможем использовать сам ИИ, чтобы предвидеть и предотвращать эти проблемы. Но это не гарантировано — как и со всеми остальными рисками, к этому нужно подходить с осторожностью.
Испытание для человечества
Чтение этого эссе может оставить впечатление, что мы оказались в пугающей ситуации. Мне определенно было непросто писать его — в отличие от «Машин любящей благодати», работа над которыми напоминала придание формы и структуры удивительно красивой музыке, годами звучавшей в моей голове. И в нашей ситуации действительно много объективно трудных моментов. ИИ несет угрозы человечеству с самых разных сторон, причем между этими опасностями существует реальное противоречие: попытки смягчить одни риски могут усугубить другие, если мы не будем действовать предельно аккуратно.
Необходимость тратить время на тщательное выстраивание систем ИИ, дабы они не вышли из-под контроля, вступает в прямое противоречие с потребностью демократических стран опережать авторитарные режимы, чтобы не оказаться у них в подчинении. Но, в свою очередь, те же самые инструменты ИИ, которые необходимы для борьбы с автократиями, при чрезмерном увлечении ими могут быть обращены внутрь наших собственных стран, ведя к тирании. Терроризм с использованием ИИ может унести миллионы жизней из-за злоупотреблений биологическими технологиями, но чрезмерная реакция на эту угрозу способна направить нас по пути к авторитарному государству тотальной слежки. Последствия ИИ для рынка труда и концентрации капитала, помимо того, что они сами по себе являются тяжелейшими проблемами, могут заставить нас решать все остальные вызовы в атмосфере общественного гнева и, возможно, даже гражданских беспорядков, вместо того чтобы иметь возможность обратиться к лучшим сторонам нашей человеческой природы. И прежде всего, само количество этих рисков, включая неизвестные, и необходимость решать их все одновременно создают устрашающую полосу препятствий, которую человечеству волей-неволей придется пройти.
Более того, опыт последних нескольких лет ясно показывает, что идея остановить или хотя бы существенно замедлить развитие технологий в корне несостоятельна. Формула создания мощных систем ИИ невероятно проста — до такой степени, что они, можно сказать, рождаются спонтанно при правильном сочетании данных и вычислительных мощностей. Создание мыслящих машин, вероятно, стало неизбежным в тот самый миг, когда человечество изобрело транзистор (или, если угодно, еще раньше — когда мы впервые приручили огонь). Если ИИ не построит одна компания, другие сделают это практически с той же скоростью. Если бы все компании в демократических странах остановили или замедлили разработки по обоюдному согласию или закону, авторитарные режимы просто продолжили бы идти вперед. Учитывая колоссальную экономическую и военную ценность этих технологий, а также отсутствие каких-либо реальных механизмов принуждения к соблюдению таких ограничений, я не вижу, как мы могли бы убедить их остановиться.
При этом я вижу путь к небольшому сдерживанию развития ИИ, который вполне укладывается в реалистичный взгляд на геополитику). Этот путь заключается в том, чтобы на несколько лет затормозить продвижение автократий к мощному ИИ, лишив их ресурсов, необходимых для его создания,[46] а именно микрочипов и оборудования для их производства. Это, в свою очередь, даст демократическим странам буфер времени, который они смогут «потратить» на более осторожное создание мощного ИИ, уделяя больше внимания его рискам, но при этом двигаясь достаточно быстро, чтобы уверенно опережать автократии. А соперничество между ИИ-компаниями внутри самих демократических стран можно будет урегулировать в рамках единого правового поля с помощью сочетания отраслевых стандартов и государственного контроля.
Anthropic активно отстаивала этот путь, лоббируя экспортный контроль чипов и взвешенное регулирование ИИ, но даже эти, казалось бы, здравые предложения были по большей части отвергнуты политиками и лицами, принимающими решения, в Соединенных Штатах (а ведь именно там их принятие важнее всего). На кону стоят столь гигантские деньги — буквально триллионы долларов в год, — что даже самым простым мерам невероятно трудно преодолеть политико-экономические стимулы, заложенные в самой гонке ИИ. В этом и заключается ловушка: ИИ — настолько могущественный инструмент и настолько желанный приз, что человеческой цивилизации крайне трудно наложить на него хоть какие-то ограничения.
Я могу представить, как представлял Саган в «Контакте», что этот же сюжет разыгрывается на тысячах планет по всей Вселенной. Некий вид обретает разум, учится пользоваться инструментами, начинает экспоненциальное технологическое восхождение, сталкивается с кризисами индустриализации и ядерного оружия, и, если выживает после них, встает перед самым сложным, финальным испытанием — когда учится превращать обычный песок в мыслящие машины. Сможем ли мы пройти эту проверку и построить прекрасное общество, описанное в «Машинах любящей благодати», или же падем жертвой рабства и гибели, зависит от нашего характера и решимости как вида, от нашей силы духа и нашей души.
Вопреки многочисленным препятствиям, я верю, что у человечества есть внутренние силы, чтобы выдержать этот экзамен. Меня воодушевляет и вдохновляет пример тысяч исследователей, которые посвятили свои карьеры тому, чтобы помочь нам понять ИИ-модели и научиться управлять ими, формируя характер и конституцию этих систем. Я думаю, у нас есть отличные шансы, что эти усилия принесут плоды вовремя. Меня обнадеживает, что по крайней мере некоторые компании заявили о готовности нести ощутимые коммерческие издержки, чтобы не допустить, что их модели будут способствовать биотеррористической угрозе. Меня обнадеживает, что несколько смелых людей пошли против господствующего политического ветра и приняли законы, закладывающие первые основы разумных защитных рамок для систем ИИ. Меня подпитывает вера в то, что общество осознает риски ИИ и требует их решения. Наконец, меня вдохновляет непреклонный дух свободы во всем мире и решимость людей сопротивляться тирании, где бы она ни возникала.
Но если мы хотим добиться успеха, нам придется резко усилить наши усилия. Первый шаг состоит в том, чтобы те, кто ближе всего стоит к этим технологиям, просто открыто сказали правду о ситуации, в которой оказалось человечество, — то, что я всегда старался делать и делаю с еще большей прямотой и неотложностью в этом эссе. Следующий шаг — убедить мыслителей, политиков, бизнес и граждан по всему миру в неотложности и первостепенной важности этого вызова, показать им, что данная проблема заслуживает интеллектуальных усилий и политического капитала гораздо больше, чем тысячи других тем, ежедневно доминирующих в новостях. А затем придет время для мужества — когда достаточному числу людей потребуется пойти наперекор господствующим трендам и твердо встать на защиту принципов, даже несмотря на угрозы их экономическим интересам и личной безопасности.
Предстоящие годы будут невероятно трудными, они потребуют от нас больше, чем, как нам кажется, мы способны дать. Но за то время, что я провел в роли исследователя, руководителя и гражданина, я видел достаточно мужества и благородства, чтобы верить в нашу победу. Я верю, что, оказавшись в самых темных обстоятельствах, человечество способно — пусть даже в самую последнюю минуту — собраться с силами и проявить мудрость, необходимую для победы. Нельзя терять ни минуты.
Я хотел бы поблагодарить Эрика Бринолфссона (Erik Brynjolfsson), Бена Бьюкенена (Ben Buchanan), Мариано-Флорентино Куэльяра (Mariano-Florentino Cuéllar), Аллана Дэфо (Allan Dafoe), Кевина Эсвелта (Kevin Esvelt), Ника Бекстеда (Nick Beckstead), Ричарда Фонтейна (Richard Fontaine), Джима Макклейва (Jim McClave) и очень многих сотрудников Anthropic за их полезные комментарии к черновикам этого эссе.
Сноски
Сноски
- [1] Это симметрично мысли, которую я высказал в «Машинах любящей благодати», начав с того, что на плюсы ИИ не стоит смотреть как на пророчество о спасении, и что важно быть конкретными, приземленными и избегать пафоса. В конечном счете пророчества о спасении и пророчества о гибели одинаково бесполезны для взаимодействия с реальным миром примерно по одним и тем же причинам.
- [2] Цель Anthropic — сохранять последовательность в условиях подобных перемен. Когда разговоры о рисках ИИ были политически популярны, Anthropic осторожно выступала за взвешенный и основанный на фактах подход к этим рискам. Теперь, когда говорить о рисках ИИ политически непопулярно, Anthropic продолжает осторожно выступать за взвешенный и основанный на фактах подход к этим рискам.
- [3] Со временем я стал гораздо сильнее уверен в траектории развития ИИ и вероятности того, что он превзойдет человеческие способности по всем направлениям, но некоторая неопределенность все еще сохраняется.
- [4] Отличным примером этого является экспортный контроль чипов. Он прост и, судя по всему, в основном работает.
- [5] И конечно, поиск таких доказательств должен быть интеллектуально честным, способным выявить в том числе и свидетельства отсутствия опасности. Повышение прозрачности с помощью карт систем (system cards) и других раскрытий информации — это как раз попытка предпринять такое интеллектуально честное исследование.
- [6] Действительно, с момента написания «Машин любящей благодати» в 2024 году системы ИИ научились выполнять задачи, которые требуют у людей нескольких часов работы; организация METR недавно оценила, что Opus 4.5 может выполнять задачи объемом около четырех человеко-часов с надежностью в 50%.
- [7] И поясню: даже если в техническом смысле до мощного ИИ осталось всего 1–2 года, многие его социальные последствия (как позитивные, так и негативные) могут проявиться на несколько лет позже. Вот почему я могу одновременно считать, что ИИ вытеснит или затронет 50% офисных рабочих мест начального уровня (entry-level) в течение 1–5 лет, и при этом полагать, что ИИ, превосходящий всех людей, может появиться у нас уже через 1–2 года.
- [8] Стоит добавить, что общественность (в отличие от политиков), судя по всему, очень обеспокоена рисками ИИ. Я думаю, что в каких-то вопросах фокус их внимания верен (например, вытеснение рабочих мест искусственным интеллектом), а в каких-то — ошибочен (например, опасения по поводу потребления воды дата-центрами ИИ, которое не столь существенно). Эта ответная реакция общества дает мне надежду на то, что консенсус вокруг решения проблем возможен, но пока это не вылилось в изменения в политике, не говоря уже об эффективных или точечных мерах регулирования.
- [9] Разумеется, они также могут манипулировать большим количеством людей (или просто платить им) для выполнения необходимых действий в физическом мире.
- [10] Я не считаю этот аргумент надуманным (подставным оппонентом): насколько я понимаю, именно этой позиции придерживается, например, Ян Лекун (Yann LeCun).
- [11] См., например, раздел 5.5.2 (стр. 63–66) карты системы Claude 4 (Claude 4 system card).
- [12] Существует также ряд других допущений, присущих этой простой модели, которые я не буду здесь обсуждать. В широком смысле они должны заставить нас меньше беспокоиться о конкретном простом сценарии невыровненного стремления к власти, но при этом сильнее переживать из-за возможного непредсказуемого поведения, которое мы не предусмотрели.
- [13] В книге «Игра Эндера» (Ender’s Game) описана похожая ситуация, но с участием людей, а не ИИ.
- [14] Например, моделям могут говорить не совершать те или иные плохие поступки и одновременно слушаться людей, но затем модель может обнаружить, что многие люди совершают именно эти плохие поступки! Неясно, как разрешится это противоречие (и хорошо составленная конституция должна побуждать модель разрешать подобные конфликты изящно), однако этот тип дилеммы мало чем отличается от якобы «искусственных» ситуаций, в которые мы помещаем модели ИИ во время тестирования.
- [15] К слову, одно из преимуществ того, что конституция написана на естественном языке, заключается в ее доступности для понимания всем миром. Это значит, что ее может критиковать кто угодно и сравнивать с аналогичными документами других компаний. Было бы здорово запустить «гонку за лидерство», которая бы побуждала компании не просто публиковать такие документы, но и делать их качественными.
- [16] Существует даже гипотеза о глубоком объединяющем принципе, связывающем подход на основе формирования характера из Конституционного ИИ с результатами исследований в области интерпретируемости и выравнивания. Согласно этой гипотезе, фундаментальные механизмы, управляющие Claude, изначально возникли как способ симуляции персонажей на этапе предварительного обучения — например, для предсказания того, что сказали бы герои романа. Из этого следовало бы, что конституцию полезнее понимать не как набор правил, а скорее как описание персонажа, которое модель использует для создания устойчивой персоны. Это также помогает объяснить результат «я, должно быть, плохой человек», о котором я упоминал выше (поскольку модель пытается вести себя так, словно она является последовательным персонажем — в данном случае плохим), и указывает на то, что методы интерпретируемости должны быть способны обнаруживать «психологические черты» внутри моделей. Наши исследователи работают над проверкой этой гипотезы.
- [17] Для ясности отмечу, что мониторинг осуществляется с соблюдением конфиденциальности личных данных.
- [18] Даже в наших собственных экспериментах с добровольно принятыми правилами в рамках нашей Политики ответственного масштабирования (Responsible Scaling Policy), мы раз за разом убеждались, что очень легко скатиться в излишнюю жесткость, проводя границы, которые казались важными априори (ex ante), но выглядят нелепо ретроспективно. Когда технологии развиваются стремительно, невероятно легко установить правила совсем не для тех вещей, для которых нужно.
- [19] SB 53 и RAISE вообще не распространяются на компании с годовым доходом менее 500 миллионов долларов. Они применяются только к более крупным, устоявшимся игрокам вроде Anthropic.
- [20] Впервые я прочитал эссе Джоя 25 лет назад, сразу после публикации, и оно оказало на меня глубокое влияние. И тогда, и сейчас я считаю его чересчур пессимистичным — не думаю, что выходом является полный «отказ» от целых направлений технологий, к которому призывал Джой. Тем не менее поднятые им вопросы оказались на удивление пророческими, а само эссе написано с глубоким чувством сострадания и гуманизма, которое меня восхищает.
- [21] Нам также приходится беспокоиться о государственных игроках — как сейчас, так и в будущем; этот вопрос я подробно разберу в следующем разделе.
- [22] Существуют данные, показывающие, что многие террористы относительно хорошо образованы, что на первый взгляд противоречит моему тезису об обратной корреляции между способностями и мотивацией. Однако я считаю, что на самом деле эти наблюдения вполне совместимы: если порог способностей для успешной атаки высок, то по определению те, кто сейчас добивается успеха, должны обладать высокими способностями, даже если способности и мотивация связаны обратной корреляцией. Но в мире, где ограничения по способностям будут стерты (например, с помощью будущих LLM), я бы ожидал, что значительная часть людей, у которых есть мотив убивать, но не хватает способностей, начнет действовать — точно так же, как мы наблюдаем это в случае преступлений, не требующих особых талантов (вроде стрельбы в школах).
- [23] Тем не менее секта «Аум Синрикё» предпринимала такие попытки. Руководитель направления в секте Сэйити Эндо обучался вирусологии в Киотском университете пытался получить возбудителя сибирской язвы и вирус Эбола. Однако по состоянию на 1995 год даже ему не хватило знаний и ресурсов для достижения этой цели. Сегодня этот порог стал значительно ниже, а LLM могут опустить его еще сильнее.
- [24] Странный феномен, связанный с массовыми убийцами, заключается в том, что выбираемый ими способ расправы порой подчиняется какой-то гротескной моде. В 1970-х и 1980-х годах были крайне распространены серийные убийцы, причем новые преступники часто копировали почерк более известных предшественников. В 1990-х и 2000-х годах более частыми стали массовые расстрелы, а серийные убийства пошли на спад. Никаких технологических сдвигов, которые спровоцировали бы эти изменения, не происходило; судя по всему, убийцы просто копировали поведение друг друга, и «популярные» тренды в этой ужасной среде сменились.
- [25] Любители джейлбрейков порой думают, что скомпрометировали эти классификаторы, когда им удается заставить модель выдать какую-то одну конкретную деталь — например, последовательность генома вируса. Однако, как я объяснял ранее, реальная угроза, которая нас беспокоит, заключается в пошаговом интерактивном руководстве в течение недель или месяцев по конкретным малоизвестным этапам производства биооружия, и именно от этого защищают наши классификаторы. (Мы часто описываем наши исследования как поиск «универсальных» джейлбрейков — тех, которые работают не в одной конкретной или узкой теме, а в целом разблокируют опасное поведение модели).
- [26] Хотя мы продолжим инвестировать в повышение эффективности наших классификаторов, и со стороны компаний было бы разумно делиться друг с другом подобными наработками.
- [27] Разумеется, я не считаю, что компании должны раскрывать технические детали конкретных заблокированных этапов производства биооружия, и принятые на данный момент законы о прозрачности (SB 53 и RAISE) учитывают этот нюанс.
- [28] Еще одна связанная идея — создание «рынков устойчивости» (resilience markets), когда правительство стимулирует создание запасов СИЗ, респираторов и другого жизненно важного оборудования для реагирования на биоатаку, заранее гарантируя выкуп этого оборудования по фиксированной цене в случае чрезвычайной ситуации. Это мотивирует поставщиков формировать резервы без опасений, что государство конфискует их без компенсации.
- [29] Почему я больше беспокоюсь о крупных силах в контексте захвата власти и о мелких игроках в контексте разрушений? Потому что у этих процессов разная динамика. Захват власти связан со способностью одного игрока накопить силу, достаточную для подчинения всех остальных — поэтому здесь стоит опасаться наиболее могущественных субъектов и тех, кто ближе всего к ИИ. Разрушение же, напротив, может быть осуществлено силами, практически не обладающими властью, если защищаться от него гораздо труднее, чем наносить ущерб. В таком случае игра сводится к обороне от самых многочисленных угроз, которые чаще всего исходят именно от мелких игроков.
- [30] Это может показаться противоречащим моему тезису о том, что баланс атаки и обороны в киберпространстве более уравновешен, чем в биологии, но моя тревога здесь связана с тем, что если ИИ какой-то страны окажется самым мощным в мире, другие просто не смогут защититься, даже если сама по себе технология имеет внутренний баланс между защитой и нападением.
- [31] Например, в США к таким механизмам относятся Четвертая поправка к Конституции и Закон о возможности использования сухопутных войск (Posse Comitatus Act).
- [32] Также поясню: есть определенные доводы в пользу строительства крупных дата-центров в странах с различными политическими режимами, особенно если они контролируются компаниями из демократических государств. Такое расширение инфраструктуры в теории может помочь демократиям успешнее конкурировать с КПК, представляющей наибольшую угрозу. Кроме того, я думаю, что такие дата-центры не несут больших рисков, если они не являются сверхкрупными. Но в целом осторожность необходима при размещении очень больших дата-центров в странах, где институциональные гарантии и механизмы верховенства закона развиты слабее.
- [33] Это, безусловно, также довод в пользу повышения безопасности ядерного сдерживания с целью сделать его более устойчивым к воздействию мощного ИИ, и ядерные демократии должны этим заниматься. Но мы не знаем, на что будет способен мощный ИИ и какие защитные меры (если таковые найдутся) сработают против него, поэтому не стоит рассчитывать, что эти шаги гарантированно решат проблему.
- [34] Существует также риск того, что даже если ядерное сдерживание сохранит свою эффективность, страна-агрессор может решить проверить нас на блеф — неясно, согласимся ли мы применить ядерное оружие для защиты от роя дронов, даже если этот рой несет в себе реальную угрозу завоевания. Рои дронов могут стать новой реальностью — менее разрушительной, чем ядерные удары, но более грозной, чем конвенциональное оружие. Кроме того, расхождения в оценках эффективности ядерного щита в эпоху ИИ могут дестабилизировать теорию игр в ядерных конфликтах.
- [35] Поясню: я считаю стратегию отказа от продажи чипов Китаю абсолютно верной, даже если бы сроки создания мощного ИИ были существенно больше. Мы не можем сделать Китай «зависимым» от американских чипов — они в любом случае твердо намерены развивать собственную полупроводниковую отрасль. На это у них уйдет много лет, и продавая им чипы сейчас, мы лишь даем им мощное ускорение на этот период.
- [36] Для ясности уточню, что большая часть оружия, используемого сегодня в Украине и Тайване, не является полностью автономным. Такое оружие уже на подходе, но сегодня его еще нет.
- [37] Наша карта системы для Claude Opus 4.5, нашей самой новой модели, показывает, что Opus справляется с собеседованием по инженерии производительности, которое часто проводят в Anthropic, лучше, чем любой кандидат за всю историю компании.
- [38] «Написание всего кода» и «выполнение задачи инженера-программиста от начала и до конца» — это совершенно разные вещи, поскольку разработчики делают гораздо больше, чем просто пишут код: это включает тестирование, работу со средами, файлами и установкой ПО, управление развертываниями в облачной инфраструктуре, итеративную доработку продуктов и многое другое.
- [39] Компьютеры в определенном смысле универсальны, но сами по себе они явно не способны воспроизвести подавляющее большинство человеческих когнитивных навыков, даже притом что они значительно превосходят людей в некоторых областях (например, в арифметике). Разумеется, технологии, построенные поверх компьютеров (такие как ИИ), теперь способны на широкий спектр когнитивных функций, чему и посвящено это эссе.
- [40] Проясню: модели ИИ обладают не совсем тем же профилем сильных и слабых сторон, что и люди. Однако они развиваются довольно равномерно по всем направлениям, так что неравномерность этого профиля в конечном итоге может не иметь значения.
- [41] Хотя среди экономистов ведутся дискуссии по поводу этой гипотезы.
- [42] Личное богатство — это накопительная величина («запас»), тогда как ВВП — это потоковая величина («поток»), поэтому данное утверждение не означает, будто Рокфеллер владел 2% всей экономической ценности США. Однако измерить общее богатство нации сложнее, чем ВВП, а индивидуальные доходы людей сильно колеблются от года к году, поэтому трудно сопоставить эти показатели в одних единицах. Отношение крупнейшего личного состояния к ВВП, хоть и не является сравнением абсолютно аналогичных сущностей, тем не менее служит вполне разумным ориентиром для оценки экстремальной концентрации богатства.
- [43] Общая стоимость труда в экономике составляет 60 триллионов долларов в год, так что 3 триллиона в год соответствовали бы 5% от этой величины. Такую сумму могла бы зарабатывать компания, которая предоставляла бы услуги труда по цене в 20% от человеческой стоимости и удерживала бы 25% рынка, даже если бы спрос на рабочую силу не рос (хотя из-за более низкой стоимости он почти наверняка бы вырос).
- [44] Проясню: я не думаю, что реальный рост производительности за счет ИИ уже обеспечивает существенную долю экономического роста США. Скорее, расходы на дата-центры представляют собой рост, вызванный опережающими инвестициями: рынок ожидает будущего экономического бума за счет ИИ и инвестирует соответствующим образом.
- [45] Когда мы согласны с администрацией, мы говорим об этом открыто и ищем точки соприкосновения, где взаимно поддерживаемая политика действительно идет на пользу миру. Мы стремимся быть честными независимыми посредниками, а не сторонниками или противниками какой-либо конкретной политической партии.
- [46] Я не думаю, что можно выиграть больше, чем несколько лет: на более длинных горизонтах планирования они в любом случае научатся производить собственные чипы.