Anthropic запускает беспрецедентную проверку Claude — независимые эксперты получат доступ внутрь компании
Anthropic сделала новый шаг в сторону более жёсткого контроля за развитием ИИ. Компания договорилась с Accenture о создании команды независимых специалистов, которые будут работать непосредственно внутри Anthropic и проверять безопасность моделей Claude.
Anthropic привлекает Accenture в качестве независимого оценщика своих передовых ИИ-моделей. Специалисты компании будут не просто тестировать готовые версии Claude, а получат доступ к внутренним процессам разработки и смогут наблюдать за тем, как модели обучаются и принимаются решения об их создании и запуске.
Проверка ИИ изнутри
Новая схема получила название embedded evaluation — встроенная независимая оценка. В отличие от обычного внешнего аудита, специалисты Accenture будут работать рядом с сотрудниками Anthropic и получат доступ, сопоставимый с уровнем доступа сотрудников компании.
Их задача — проводить red team-тестирование, намеренно искать способы обойти защитные механизмы Claude, оценивать соответствие поведения моделей заявленным целям и проверять существующие процедуры безопасности. Кроме того, специалисты смогут отслеживать решения, влияющие на обучение и развёртывание моделей.
Anthropic рассчитывает таким образом выявлять так называемые слепые зоны — проблемы, которые могут оставаться незаметными самой компании. Оценщики также смогут фиксировать инциденты и предоставлять информацию о потенциальных рисках.
На безопасность потратят минимум $2 млрд
Партнёрство рассчитано на пять лет. Anthropic и Accenture намерены вложить как минимум по $1 млрд каждая в развитие возможностей независимой оценки и безопасности ИИ. Работу со стороны Accenture возглавит её специализированное AI-подразделение Faculty.
При этом Anthropic признаёт, что сама концепция встроенной независимой оценки пока находится на ранней стадии. Общих стандартов того, какой доступ должны получать проверяющие и как именно они должны публиковать результаты, пока нет.
Это продолжение призыва замедлить развитие ИИ
Инициатива появилась вскоре после заявления главы Anthropic Дарио Амодеи, который призвал разработчиков передовых ИИ-моделей снизить темпы наращивания их возможностей и дать больше времени на создание механизмов безопасности. Одним из ключевых элементов его предложения как раз было появление независимых оценщиков с доступом непосредственно внутрь AI-компаний.
При этом Anthropic подчёркивает, что не собирается прекращать разработку новых моделей. Компания намерена продолжать обучать и выпускать передовые системы, но одновременно хочет, чтобы рядом с разработчиками постоянно работали независимые специалисты по безопасности.
Полностью независимым аудит пока не стал
Есть и важное ограничение: работу Accenture финансирует сама Anthropic. В компании признают, что в долгосрочной перспективе финансирование независимых оценщиков желательно осуществлять через объединённые фонды или государственные механизмы, однако таких систем пока нет.
Anthropic также ведёт переговоры с некоммерческой организацией METR и другими оценщиками о запуске дополнительных пилотных проектов. Партнёрство с Accenture при этом не является эксклюзивным.
Вывод: Anthropic фактически экспериментирует с новой моделью контроля над развитием ИИ, при которой независимые специалисты получают возможность наблюдать за разработкой моделей практически изнутри. Насколько такой подход окажется действительно независимым и сможет ли он выявлять проблемы раньше самих разработчиков, покажет только практика.