CEO Anthropic Dario Amodei publicznie wezwał do spowolnienia rozwoju przełomowych technologii AI i zaproponował przyznanie niezależnym ewaluatorom takim jak METR bezpośredniego dostępu do modeli Anthropic w celu weryfikacji zobowiązań firmy dotyczących bezpieczeństwa — znaczące ustępstwo strukturalne ze strony laboratorium, które stworzyło Claude.\n\n## Kluczowe wnioski\n\n- CEO Anthropic Dario Amodei opublikował formalną propozycję „zwolnienia tempa na froncie" — zmniejszenia prędkości rozwoju możliwości AI w wiodących laboratoriach.\n- Plan obejmuje przyznanie organizacjom trzecim, konkretnie wymieniając METR, dostępu do modeli Anthropic w celu audytu przestrzegania praktyk bezpieczeństwa.\n- Trójstopniowy framework Amodeia to najbardziej szczegółowa publiczna propozycja od CEO najwyższej klasy AI dotycząca nałożenia zewnętrznej odpowiedzialności na wydania modeli.\n- Ten ruch następuje w momencie nasilania się presji regulacyjnej i publicznego sceptycyzmu wobec twierdzeń o bezpieczeństwie AI.\n- Dla twórców AI-art zewnętrzne audyty bezpieczeństwa mogą bezpośrednio wpłynąć na to, które możliwości zostaną ograniczone lub opóźnione w modelach, na których polegają.\n\n\n\nEsej Amodeia, opublikowany w tym tygodniu, przedstawia trójstopniowy plan, który jego firma nazywa „zwolnieniem tempa na froncie". Język jest celowy: to nie wezwanie do zatrzymania rozwoju AI, ale do zsynchronizowania prędkości z dojrzałością infrastruktury bezpieczeństwa. To rozróżnienie ma znaczenie, ponieważ Anthropic jest jednocześnie jednym z najbardziej zorientowanych na bezpieczeństwo laboratoriów i jednym z najbardziej komercyjnie agresywnych — Claude jest bezpośrednim konkurentem GPT-4o OpenAI i Gemini Google na rynku korporacyjnym.\n\n## Co faktycznie oznacza dostęp stron trzecich do modeli Anthropic\n\nKonkretne zobowiązanie wobec METR — organizacji non-profit, która ocenia modele AI pod kątem niebezpiecznych autonomicznych możliwości — to najbardziej konkretny element propozycji Amodeia. Dostęp METR oznacza, że niezależni badacze, a nie własne czerwone zespoły Anthropic, oceniliby, czy modele Claude spełniają określone progi bezpieczeństwa przed lub podczas wdrożenia. To inny standard niż wewnętrzne oceny, które większość laboratoriów obecnie publikuje.\n\nDla twórców budujących przepływy pracy na API Claude lub używających narzędzi, które działają na Claude pod maską, ma to rzeczywisty wpływ downstream: jeśli METR oznaczy możliwość jako niewystarczająco bezpieczną, Anthropic prawdopodobnie byłoby zobowiązane do jej ograniczenia lub opóźnienia. Może to oznaczać wolniejsze wprowadzanie nowych funkcji multimodalnych, ostrzejsze filtry wyjściowe lub ograniczenia możliwości, które nie dotyczą konkurentów, którzy nie podjęli podobnego zobowiązania.\n\n> „Nadszedł czas, aby zahamować AI."\n>\n> — Dario Amodei, CEO Anthropic\n\nWarto zauważyć historyczną analogię. Kiedy Stability AI stanęło w obliczu narastającej presji w 2023 roku z powodu niekontrolowanego generowania obrazów i braku formalnych procesów bezpieczeństwa, brak jakiegokolwiek zewnętrznego mechanizmu odpowiedzialności sprawił, że firma nie mogła wiarygodnie się samoregulować — co przyczyniło się do odejść kadry kierowniczej i szkód reputacyjnych, które nastąpiły. Amodei w efekcie próbuje zinstytucjonalizować odpowiedzialność, której Stability nigdy nie miało, zanim podobny kryzys ją wymusi.\n\n## Kwestia dźwigni: kto faktycznie to egzekwuje?\n\nPropozycja jest dobrowolna. Amodei nie ogłasza umowy regulacyjnej ani wiążącego standardu branżowego — publikuje esej i wymienia preferowanego audytora. Mechanizm egzekwowania jest reputacyjny: jeśli Anthropic nie będzie przestrzegać własnego określonego frameworka, METR lub zewnętrzni obserwatorzy mogą to publicznie stwierdzić. To znacząca presja, ale to nie to samo co prawny obowiązek.\n\nMa to znaczenie dla każdego, kto śledzi, które modele generowania obrazów i wideo AI pozostają nieograniczone, a które stoją w obliczu wycofania możliwości. Laboratoria, które nie przyjmą podobnych frameworków — a kilka głównych nie dało żadnych wskazówek, że to zrobią — nie stoją w obliczu równoważnego ograniczenia. Asymetria konkurencyjna może skłonić Anthropic do bardziej ostrożnego podejścia do nowych funkcji generatywnych, podczas gdy rywale będą dostarczać szybciej.\n\nBadania podzbioru bezpieczeństwa Hugging Face opublikowane wcześniej w tym roku pokazały, że ukierunkowane filtry bezpieczeństwa mogą być wystarczająco precyzyjne, aby blokować konkretne szkodliwe wyniki bez nadmiernego odrzucania całych obszarów tematycznych — co sugeruje, że techniczne narzędzia dla tego rodzaju audytowanego ograniczenia się poprawiają. Pytanie brzmi, czy komercyjne zachęty branży pozwolą laboratoriom używać ich w tempie, które proponuje Amodei.\n\nDla twórców oceniających, na których modelach budować, katalog modeli Charmloop śledzi zmiany możliwości i dostępu w miarę ich występowania. Następnym konkretnym wskaźnikiem tego, czy propozycja Amodeia ma zęby, będzie to, czy METR opublikuje jakiekolwiek ustalenia — i czy harmonogram wydań Anthropic w widoczny sposób się zmieni w rezultacie.