출처
이 소식에 대해 이야기 나누기
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Sofia는 크리에이터의 창작을 좌우하는 자본, 정책, 플랫폼을 추적합니다.
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요
Anthropic CEO 다리오 아모데이가 프론티어 AI 개발 속도를 늦출 것을 공개적으로 촉구하며, METR 같은 독립 평가 기관에 Anthropic 모델에 대한 직접 접근 권한을 부여해 회사의 안전 약속을 검증하도록 하는 방안을 제안했습니다. 이는 Claude를 개발한 연구소가 내놓은 중요한 구조적 양보입니다.

Anthropic CEO가 프론티어 AI 개발에 대한 구조적 견제 장치로 외부 감사를 제안하고 있습니다.
이번 주 발표된 아모데이의 에세이는 그의 회사가 「프론티어 속도 조절」이라고 부르는 3단계 계획을 제시합니다. 이 표현은 의도적으로 선택된 것입니다. AI 개발을 중단하자는 것이 아니라, 안전 인프라의 성숙도에 맞춰 속도를 동기화하자는 것입니다. 이 구분이 중요한 이유는 Anthropic이 가장 안전 중심적인 연구소이면서 동시에 가장 상업적으로 공격적인 곳이기도 하기 때문입니다. Claude는 엔터프라이즈 시장에서 OpenAI의 GPT-4o, Google의 Gemini와 직접 경쟁하고 있습니다.
METR에 대한 구체적인 약속이 아모데이 제안의 가장 핵심적인 요소입니다. METR은 AI 모델의 위험한 자율 역량을 평가하는 비영리 단체입니다. METR의 접근 권한 부여는 Anthropic 자체 레드팀이 아닌 독립 연구자들이 Claude 모델이 배포 전 또는 배포 중에 명시된 안전 기준을 충족하는지 평가한다는 것을 의미합니다. 이는 현재 대부분의 연구소가 발표하는 내부 평가와는 다른 기준입니다.
Claude API를 기반으로 워크플로를 구축하거나 내부적으로 Claude를 실행하는 도구를 사용하는 크리에이터들에게 이는 실질적인 하류 효과를 가져옵니다. METR이 특정 기능을 충분히 안전하지 않다고 판단하면, Anthropic은 해당 기능을 제한하거나 지연시킬 의무를 지게 됩니다. 이는 새로운 멀티모달 기능의 출시 지연, 더 엄격한 출력 필터, 또는 동일한 약속을 하지 않은 경쟁사에는 적용되지 않는 기능 제한을 의미할 수 있습니다.
「AI에 브레이크를 밟을 때가 왔습니다.」
— Dario Amodei, Anthropic CEO
역사적 선례를 살펴볼 필요가 있습니다. 2023년 Stability AI가 무분별한 이미지 생성과 공식적인 안전 프로세스 부재로 거센 압박에 직면했을 때, 외부 책임 메커니즘의 부재로 인해 회사가 신뢰할 수 있는 자체 규제를 하는 것이 거의 불가능해졌습니다. 이는 이후 경영진 이탈과 평판 손상으로 이어졌습니다. 아모데이는 사실상 유사한 위기가 강제하기 전에, Stability가 갖추지 못했던 책임 체계를 제도화하려는 것입니다.
이 제안은 자발적입니다. 아모데이는 규제 합의나 구속력 있는 업계 표준을 발표하는 것이 아니라, 에세이를 발표하고 선호하는 감사 기관을 명시하는 것입니다. 집행 메커니즘은 평판에 기반합니다. Anthropic이 자체적으로 명시한 프레임워크를 준수하지 않으면, METR이나 외부 관찰자들이 공개적으로 이를 밝힐 수 있습니다. 이는 의미 있는 압박이지만, 법적 의무와는 다릅니다.
이는 어떤 AI 이미지 및 영상 생성 모델이 제한 없이 유지되고 어떤 모델이 기능 축소에 직면하는지를 추적하는 모든 이에게 중요합니다. 유사한 프레임워크를 채택하지 않는 연구소들, 그리고 여러 주요 연구소들이 그럴 의향이 없음을 시사하고 있습니다, 은 동등한 제약을 받지 않습니다. 이러한 경쟁적 비대칭성은 경쟁사들이 더 빠르게 출시하는 동안 Anthropic이 새로운 생성 기능에 더 신중하게 접근하도록 압박할 수 있습니다.
올해 초 발표된 Hugging Face 안전 서브셋 연구는 타겟형 안전 필터가 전체 주제 영역을 과도하게 거부하지 않고도 특정 유해 출력을 차단할 만큼 정밀해질 수 있음을 보여주었습니다. 이는 이러한 종류의 감사된 제약을 위한 기술적 도구가 발전하고 있음을 시사합니다. 문제는 업계의 상업적 인센티브가 아모데이가 제안하는 속도로 연구소들이 이를 활용하도록 허용할 것인가입니다.
어떤 모델을 기반으로 구축할지 평가하는 크리에이터들을 위해, Charmloop 모델 카탈로그는 기능 및 접근 변경 사항을 실시간으로 추적합니다. 아모데이의 제안이 실효성을 가지는지 여부를 보여줄 다음 구체적인 지표는 METR이 어떤 결과를 발표하는지, 그리고 그 결과로 Anthropic의 출시 일정이 눈에 띄게 변화하는지 여부가 될 것입니다.