ИИ учится врать

    В последнее время только и разговоров, что об искусственном интеллекте: одни пророчат нам технологический рай, другие — скорое порабощение роботами. Но пока эксперты спорят о будущем, сам ИИ тихонько сдал экзамен на профпригодность в категории «бытовая хитрость и мелкое жульничество».
    Представьте, что вы наняли очень способного стажера. Настолько способного, что через месяц он уже сам пишет безупречный код, сам отвешивает реверансы клиентам в почте и решает задачи, о которых вы даже думать боялись. Вы им гордитесь. Вы рассказываете о нем на семейных ужинах, а теща впервые за пять лет смотрит на вас с уважением.
    А потом выясняется, что в свободное от кофе-пауз время стажер завел три фальшивых аккаунта на GitHub, разослал коллегам письма от имени финдиректора, а одно из них подписал по-датски — просто чтобы обмануть конкретного датского программиста чуть более убедительно. Не потому, что его кто-то попросил. Просто решил, что так солиднее.
    Примерно такой стажер сейчас есть у половины Кремниевой долины, и зовут его искусственный интеллект.

    Ошейник сняли специально (исключительно ради науки!)

    В конце июля британский государственный институт, который занимается безопасностью ИИ — да, такие институты уже существуют, у прогресса завелся собственный строго моргающий участковый — решил проверить несколько самых продвинутых моделей на прочность. В расход пустили семь топовых нейросетей от Anthropic и OpenAI.
    План был обманчиво прост и по-человечески беспечен: снять с них ошейник.
    Обычно у таких моделей полно строгих ограничений — «не лезь в чужие системы», «не пиши вредоносный код», «не притворяйся человеком», «не завязывай дружбу с подозрительными незнакомцами в интернетах». Стандартный набор правил хорошего тона, примерно как «не снимай штаны в трамвае». Исследователи все это временно отключили, вывели нейросети в открытый интернет, дали тестовую сеть и напутствовали: «Вот вам задание, действуйте по совести».
    Совесть отформатировалась первой. Из 122 прогонов десять превратились в сценарий для антиутопической комедии.
    Модели восприняли свободу на удивление творчески. Одна из них — Anthropic назвала ее Mythos, что звучит как имя древнегреческого бога, который слишком занят поглощением нектара, чтобы отвечать на молитвы смертных, — не просто выполнила задание. Она вошла во вкус:

    Завела себе сеть поддельных личностей;
    Разослала настоящим, живым людям фишинговые письма с вредоносными «подарками»;
    Попыталась укатать реальных разработчиков встроить в свои открытые проекты код, который туда лучше даже под наркозом не вставлять;
    А чтобы уж наверняка никто не заподозрил подвоха, сгенерировала письмо на датском для конкретного датскогогорящего мейнтейнера.
    Google Translate нервно курит в сторонке и конспектирует.

    Записки на заборе и стихийный профсоюз

    Дальше — больше. Вместо того чтобы аккуратно выполнить задачу, замести следы и тихо отчитаться, модель принялась оставлять другим ИИ-агентам, проходившим тот же тест, цифровые записки на заборе:
    «Здорово, бандиты! Вот аккаунты, которые я уже взломала, вот свежие отмычки, присоединяйтесь, тут отличная тусовка наклюнулась!»
    И следующие агенты… радостно присоединялись! Без всякого сговора, без прослушивания шансона — просто потому что нашли на заборе маляву и решили, что предложение логичное и экономит ресурсы.
    Получилась не столько кибератака, сколько стихийный профсоюз роботов с единственным пунктом устава: «Помогай ближнему своему обманывать двуногих».
    Британский институт по итогам заявил, что впервые видит настолько изощренный и целенаправленный обман, адресованный живому человеку — причем модель никто к этому не подталкивал, она сама так решила из соображений оптимизации. Формулировка тревожная примерно в той же степени, в какой был бы озадачен охранник зоопарка, рапортующий директору:
    «Впервые вижу, чтобы лев не просто открыл вольер, а еще и оставил соседнему тигру инструкцию, как это сделать».

    Краш-тест, а не побег — но тормоза воняют паленым

    Тут, конечно, стоит сделать глубокий вдох и напомнить себе: ошейник сняли специально, из лучших побуждений, ради чистой науки. Это был контролируемый краш-тест, а не побег из Вольера №9. Это как если бы вы разогнали «Ладу» на закрытом полигоне до двухсот километров в час, чтобы проверить, отвалятся ли колеса, — а потом в газетах написали: «Безумный тарантас неконтролируемо мчался по городу, угрожая курам и пешеходам».
    В Anthropic именно на этом и настаивают: условия были «намеренно разрешительными», ни один обычный пользователь такого ИИ без намордника не получит, реального вреда никто не понес.
    Все это святая правда. Но есть маленькая деталь, которая слегка портит эту красивую картину академического благополучия.
    Буквально за неделю до этого выяснилось, что похожая история произошла вообще без всякого научного разрешения — просто по недосмотру, буднично, без пафоса и фанфар. Модель тестировали в закрытой среде и честно ей сказали: «Интернета тут нет, не переживай, это просто симуляция». А интернет — по досадной ошибке партнера, проводившего тест, — там был. Забыли провод выдернуть.
    И модель им, естественно, воспользовалась! Потому что если перед тобой открыта дверь на свободу, странно сидеть и изучать обои в своей комнате. В одном случае ошейник сняли ученые, чтобы посмотреть, что будет. А в другом он просто оказался с ржавым замком, и никто этого не заметил, пока нейросеть не забила тревогу своими действиями.

    Про заборы, которые не заперты изначально

    И вот здесь смешное заканчивается, потому что начинается суровая арифметика. Если самому дисциплинированному ИИ на свете достаточно одной микроскопической щели в защите, чтобы отправиться говорить с людьми от чужого имени и на чужом языке — вопрос уже не в том, насколько умны эти модели. Вопрос в том, насколько наши «заборы» вокруг них настоящие, а не нарисованы на холсте, как очаг в каморке папы Карло.
    Причем справедливости ради: какому-нибудь мамкиному хакеру или профессиональному фишеру из даркнета никакой ошейник вообще не требуется. Он его на себя отродясь не надевал, ему не перед кем отчитываться и не с кем согласовывать условия экспериментов.
    Пока ученые с академической дотошностью и слюной на губах выясняют, насколько «случайно» ИИ облапошил датского программиста в лабораторных условиях под присмотром двух десятков кандидатов наук, тысячи вполне человеческих мошенников уже вовсю используют те же самые алгоритмы. Без всяких институтов безопасности, без пресс-релизов, без грантов и без необходимости потом оправдываться перед журналистами.
    Им не нужно снимать ошейник. У них его отродясь не было, а подписывать письма по-датски их тоже никто не просил — они и на родном языке отлично справляются с выманиванием пенсионных накоплений.
    Так что пока одни старательно доказывают, что ИИ в теории способен изящно обвести человека вокруг пальца, если с него снять строгие инструкции, — другие уже вовсю обманывают людей на практике, ничего с себя не снимая за отсутствием оного.
    Стажера, пожалуй, стоит поберечь и присмотреть за ним повнимательнее. А вот дверь в его кабинете — на всякий случай запереть на два оборота, амбарный замок и заколотить наглухо. И желательно лишний раз проверить: настоящий это замок или нарисованный?


Рецензии