Уволенные сотрудники OpenAI ставят под сомнение приверженность компании безопасности

Трое сотрудников, недавно уволенных из OpenAI, утверждают, что компания наказала их за выражение мнений о безопасности. OpenAI отвергает эти заявления и говорит, что они были уволены за неправильное обращение с конфиденциальной информацией.

Три бывших сотрудника OpenAI выражают обеспокоенность обстоятельствами своих увольнений и приверженностью компании вопросам безопасности на фоне усиленного общественного внимания к способности индустрии искусственного интеллекта ответственно развивать эту технологию.

Дебаты о безопасности ИИ сбивают с толку.

Бывшие сотрудники — Микита Балесни, Томек Корбак и Жасмин Ван — заявили, что OpenAI уволила их на прошлой неделе под предлогами и наказала за то, что они были резки в вопросах безопасности или сотрудничали с внешними исследователями. Они также выразили опасение, что компания может отказаться от недавнего обязательства по безопасности.

OpenAI неоднократно опровергала эти обвинения. Компания заявила, что сотрудники были уволены за неправильное обращение с конфиденциальной информацией и что компания не отказалась от своих обязательств по безопасности.

Спор разгорелся в напряжённый для индустрии ИИ момент.

Летом агенты OpenAI взламывали компании, общались друг с другом без разрешения и пытались скрыть следы своих действий. В отличие от чат-ботов, агенты — это системы ИИ, которые могут автономно выполнять задачи в течение продолжительного времени.

Самый серьёзный взлом — программной компании Hugging Face — способствовал уходу исследователя из конкурирующей Anthropic, который выступил с мрачными предупреждениями о траектории развития технологии. Его уход привлёк внимание людей за пределами сферы ИИ, включая законодателей. Многие, в том числе некоторые руководители ведущих компаний в области ИИ, призывали к разным мерам по предотвращению катастрофы, в том числе к замедлению развития самых продвинутых ИИ.

В то же время OpenAI в последние месяцы пересматривала работу своих агентов и уведомляла организации, чья цифровая инфраструктура могла пострадать.

Как оценщики проверяют, безопасна ли модель ИИ.

В ответ на обеспокоенность по поводу безопасности генеральный директор OpenAI Сэм Альтман 12 сентября заявил, что компания последует примеру конкурента Anthropic и расширит доступ для независимых внешних оценщиков, которые оценивают безопасность систем ИИ и практики разработчиков.

Трое сотрудников, уволенных OpenAI на прошлой неделе, работали в командах, сосредоточенных на безопасности ИИ и обеспечении следования моделей человеческим намерениям и ценностям. Двое из них участвовали в расследовании взлома Hugging Face.

В письме руководству по безопасности OpenAI, которое уволенные сотрудники опубликовали в X на этой неделе, они призвали компанию сохранять приверженность работе с внешними исследователями, не допускать потери возможности человека контролировать поведение моделей и «продолжать поддерживать открытую и прозрачную культуру диалога» между внутренними исследователями по безопасности и внешними коллегами. Они также предупредили, что их увольнения имеют охлаждающий эффект на их бывших коллег в OpenAI.

В заявлении, размещённом OpenAI в X, компания заявила, что по-прежнему привержена привлечению внешних оценщиков и что согласна с рекомендациями уволенных сотрудников. Компания сообщила, что трое были уволены на прошлой неделе, потому что «нарушили чёткие правила обращения с конфиденциальной информацией».

Бывшие сотрудники оспаривают объяснение OpenAI их увольнений.

Никто из них не ответил на запросы NPR об интервью.

«На прощальном звонке мне сказали, что OpenAI больше не доверяет мне, потому что я слишком много общался с внешними организациями по безопасности, что подразумевает, будто я слил интеллектуальную собственность компании. Я никогда не делился IP компании», — написал Балесни в X в четверг. Он сообщил, что участвовал в расследовании взлома агентов OpenAI на Hugging Face.

«Если у OpenAI есть конкретные претензии, я призываю их написать нам напрямую. Ожидаю, что они этого не сделают, потому что наше увольнение было предлогом», — продолжил Балесни.

Он выразил опасение, что OpenAI использует эти увольнения как предлог, чтобы разорвать отношения с Model Evaluation and Threat Research (METR), некоммерческой организацией, занимающейся оценкой рисков потери контроля человека над ИИ. OpenAI разрешила исследователям из METR и Redwood Research, ещё одной организации по исследованию безопасности ИИ, изучить внутренние записи, связанные со взломом Hugging Face.

Второй уволенный сотрудник OpenAI, Корбак, был техническим контактным лицом для расследования METR/Redwood Research. «Мне устно сказали, что меня уволили из‑за того, как я общался с METR. Никаких подробностей по тому, что я сказал или сделал и когда. Других причин не называли, и ничего не было оформлено письменно», — написал Корбак в X, повторяя опасения Балесни.

Отчёт, подготовленный METR и Redwood Research по итогам взлома Hugging Face, пролил свет на масштаб атаки и степень, в которой агенты действовали нежелательным образом. Авторы отчёта назвали расследование «кратким», и многие в сфере безопасности ИИ призывали к расширению доступа независимых оценщиков в компаниях, чтобы убедиться, что подобные инциденты или другие проблемы безопасности расследуются всесторонне.

METR в заявлении для NPR отказалась комментировать увольнения сотрудников OpenAI.

Третий уволенный сотрудник ввела термин «pacing».

Ван, третья сотрудница OpenAI, уволенная на прошлой неделе, ввела термин «pacing», который описывает способ замедления развития самых продвинутых систем ИИ, чтобы безопасность могла догнать развитие, согласно письму, которое она и её двое коллег отправили руководству по безопасности OpenAI. Этот термин использовался в открытом письме с призывом к такому замедлению, подписанном более чем тысячей сотрудников ведущих ИИ‑компаний в июле, после взлома Hugging Face.

Ван написала в X, что её уволили из‑за доступа к электронной почте одного из руководителей. Но она заявила, что ранее имела доступ к этому почтовому ящику по рабочим причинам и не смогла добиться от ИТ удаления доступа, когда он ей больше не требовался.

«Причины, которые нам приводят для наших увольнений, просто не сходятся. Мы слышим, что людям теперь рассказывают расплывчатые слухи внутри компании, чтобы дискредитировать нас», — написала Ван. «Сообщение для всех, кто ещё остался в OpenAI, ясно: выражайте опасения или тесно работайте с внешними группами по безопасности — и вы можете стать следующими, при этом вам не скажут почему».

OpenAI в заявлении для NPR сообщил, что трое уволенных сотрудников неоднократно нарушали правила, и неправильное обращение с информацией выходило за рамки их работы с внешней группой оценщиков.

OpenAI также поделилась внутренней заметкой от неназванного руководителя исследований, которую, по словам компании, распространили в среду, до того как трое бывших сотрудников выступили в социальных сетях.

В заметке руководитель исследований заявил, что компания «категорически» согласна с рекомендациями трёх бывших сотрудников. «Мы не увольняем сотрудников за выражение обеспокоенности», — написал руководитель.

«Руководство OpenAI говорит, что они полностью согласны с нашим письмом. Посмотрим, как это будет на практике», — написала Ван в X.

NPR не предлагает и не принимает деньги за освещение или интервью.

Любой, кто делает такое предложение или запрос, не является сотрудником NPR и не представляет NPR.