출처
AI 아트의 흐름을 앞서가세요
이번 주 AI와 AI 아트의 핵심 소식을 메일로 받아 보세요. 엄선되고 간결하며 무료입니다.
무료입니다. 언제든 구독을 취소할 수 있어요.
이 소식에 대해 이야기 나누기
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Elias는 헤드라인 뒤의 연구를 쉬운 언어로 풀어냅니다.
이번 주 AI와 AI 아트의 핵심 소식을 메일로 받아 보세요. 엄선되고 간결하며 무료입니다.
무료입니다. 언제든 구독을 취소할 수 있어요.
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요
DeepMind 출신들이 설립한 영국 AI 연구소 Inherent은 자사의 Faraday 에이전트가 자율적인 과학 논문 재현 능력을 측정하는 벤치마크에서 Anthropic·OpenAI 모델을 앞질렀다고 밝혔다. 논문 재현이란 연구를 읽고 그 결과를 독립적으로 재현하는 능력을 말한다.
과학 논문을 재현하는 것은 요약하는 것과 다르다. 연구를 재현할 수 있는 모델은 방법론을 분석하고, 변수를 파악하며, 기술된 과정을 실행하거나 시뮬레이션하고, 허용 오차 범위 내에서 원본과 일치하는 결과를 도출해야 한다. 레시피를 읽는 것과 실제로 요리를 제대로 완성하는 것의 차이라고 생각하면 된다. 이 차이는 구조화된 다단계 창작·기술 워크플로에 AI를 활용하는 모든 이에게 중요하다. 에이전트가 실험을 재현할 수 있게 해주는 바로 그 추론 깊이가, 복잡한 프롬프트 체인을 안정적으로 따르거나 이탈 없이 프로덕션 파이프라인을 실행할 수 있게 해주기 때문이다.
AI 아트 창작자에게 가장 직접적인 유사 사례는 에이전틱 워크플로다. 즉, 지속적인 개입 없이 생성·평가·정제 단계를 순차적으로 실행하는 시스템이다. 에이전트가 구조화된 과제를 여러 단계에 걸쳐 유지하는 능력이 강할수록, 반복적인 스타일 매칭, 배치 프롬프트 실행, 다중 패스 이미지 정제 같은 작업을 더 안정적으로 처리한다.
TechCrunch에 따르면, Inherent은 Faraday를 단순한 도구가 아닌 AI 「팀원」으로 포지셔닝한다. 단순히 요청을 처리하는 것이 아니라 연구자와 함께 일하는 존재로 규정하는 것이다. Faraday가 Anthropic·OpenAI 제품을 앞선다는 벤치마크 결과는 현 단계에서 Inherent 자체 수치다. 독립적인 제3자 평가는 아직 발표되지 않았으며, 이는 스타트업이 더 유명한 기존 강자를 이겼다고 발표할 때 항상 유념해야 할 표준적인 주의 사항이다.
그렇다 하더라도 DeepMind 출신이라는 이력은 단순한 장식이 아니다. 이 팀은 유능한 에이전트의 근간이 되는 강화학습 및 플래닝 시스템을 직접 구축한 경험을 보유하고 있으며, 연구 재현은 대부분의 리더보드 과제보다 훨씬 까다로운 목표다. 결과를 재현하는 대신 만들어내는 모델은 즉시 실패하기 때문에 환각에 대한 페널티가 매우 가혹하다.
Inherent이 「어시스턴트」나 「도구」 대신 「팀원」이라는 단어를 선택한 것은 의도적이다. 이는 하위 과제에서 주도적으로 행동하고, 스스로 작업을 검토하며, 불확실성을 덮어두지 않고 드러내는 시스템을 의미한다. 이러한 행동 특성이 독립적인 테스트에서도 유지된다면, 현재 에이전트의 실패 유형인 「자신 있는 오류」, 즉 겉으로는 그럴듯해 보이지만 요구 사항을 조용히 벗어난 결과물을 생성하는 문제가 있는 창작 맥락에서 진정으로 유용할 것이다.
연구 재현이라는 프레이밍은 또한 Faraday를 Anthropic(Claude의 컴퓨터 사용 기능)과 OpenAI가 치열하게 경쟁하는 에이전틱 AI 공간에 정면으로 위치시킨다. 소규모 연구소가 이 특정 역량에서 벤치마크 선두를 주장한다는 것은, AI의 에이전틱 계층이 두 강자의 경쟁이 아닌 진정한 다자 경쟁 구도로 접어들고 있다는 신호다.
이미지 생성을 넘어 AI 도구를 탐색하는 창작자, 즉 에이전트를 활용해 레퍼런스 수집, 스타일 분석, 프롬프트 반복 작업을 자동화하려는 이들에게 Faraday 발표는 주목할 만하다. 실질적인 질문은 Inherent이 Faraday를 폭넓게 공개할지, 아니면 연구 파트너 모델로 유지할지 여부다. 공개 출시일이나 가격은 아직 발표되지 않았다. 재현 벤치마크에 대한 독립적인 재현이 나오기 전까지 이 수치는 판정이 아닌 주장에 불과하지만, 구체적이고 반증 가능한 주장이라는 점에서 대부분의 스타트업 벤치마크보다는 낫다.
AI 보조 워크플로를 이미 실험 중인 창작자는 에이전틱 모델 계층이 계속 발전하는 동안 Charmloop 가이드에서 현세대 도구가 지원하는 기능을 살펴볼 수 있다.