3줄 핵심 요약
| 구분 | 주요 내용 |
|---|---|
| 혁신 프레임워크 | 세일즈포스 AI 연구팀이 기저 모델을 변경하지 않고 프롬프트, 도구, 워크플로 등 '하네스'만을 진화시키는 프레임워크 '다윈X(DarwinX)'를 공개했다. |
| 성능 향상 결과 | 웹 브라우징 벤치마크(WebArena-Infinity)에서 에이전트 작업 완료 성공률을 기존 43.5%에서 93%로 두 배 이상 끌어올리는 성과를 거뒀다. |
| 기술적 의의 | 모델 미세조정(파인튜닝) 없이 애플리케이션 개발자가 제어 가능한 오케스트레이션 계층 최적화만으로 엔터프라이즈 AI 에이전트의 신뢰성을 극대화할 수 있는 길을 열었다. |
보도 기사 본문
세일즈포스 AI 연구소(Salesforce AI Research)와 세일즈포스 에이전트포스(Salesforce Agentforce) 연구진이 인공지능(AI)
모델 자체의 가중치를 일절 수정하지 않고도 브라우저 기반 작업 수행 능력을 비약적으로 끌어올리는 신규 프레임워크
'다윈X(DarwinX)'를 16일(현지시간) 공개했다. 이번 연구에 따르면 동결된 대형언어모델(LLM)을 기반으로 웹 탐색
작업을 수행하는 AI 에이전트의 성공률이 기존 43.5%에서 93%로 두 배 이상 수직 상승한 것으로 나타났다.
기존의 자기 개선형 AI 에이전트는 작업 실패 원인을 분석해 프롬프트를 수정하거나 도구를 변경하는 단일 루프 방식을 주로
채택해 왔다. 그러나 이러한 방식은 특정 실패를 해결하는 과정에서 이전에 잘 작동하던 작업이 망가지는 '교차 작업 간섭
(cross-task interference)'이나, 초기의 부분적 수정이 전체 최적화를 가로막는 '경로 의존성(path dependence)'에 갇혀
성능 한계에 직면하는 고질적인 문제가 존재했다.
연구진은 이를 해결하기 위해 생물학적 자연선택에서 착안한 진화론적 알고리즘을 도입했다. 다윈X는 단일 버전을 덮어쓰는
대신 다양한 하네스(Harness, 모델을 둘러싼 프롬프트·도구·제어 흐름) 변종을 생성하고 보관한다. 이후 신규 기능이
추가되더라도 기존에 해결했던 과제에서 성능 퇴보(regression)가 발생하지 않는지 엄격한 게이트 검증을 거친 변종만을
통과시키며, 서로 다른 영역에 특화된 장점을 지닌 전문 에이전트들을 결합(merge)하여 단일 전문 에이전트를
뛰어넘는 최적의 하네스를 구축하도록 설계됐다.
실제 성능 검증 결과, 다윈X는 터미널 벤치마크(Terminal-Bench 2.1)에서 75.5%였던 점수를 83.2%까지 끌어올렸으며,
특히 머신러닝과 과학 계산 과제에서 14.8점, 데이터베이스 과제에서 13.8점의 뚜렷한 향상을 기록했다.
또한 300개의 합성 인텐트로 진화시킨 브라우저 하네스를 1,260개의 실제 미공개 과제(WebArena-Infinity)에
적용한 결과, 작업 성공률이 43.5%에서 93%로 급증했다. 소프트웨어 엔지니어링 벤치마크(SWE-bench Verified)
에서도 피드백 없이 84.2%의 높은 해결률을 달성해 다른 도메인으로의 전이 능력까지 입증했다.
이번 성과는 거대 모델을 직접 학습시키거나 파인튜닝할 자원이 부족한 일반 애플리케이션 개발자들에게 실질적인
돌파구를 제공할 것으로 전망된다. 호스팅된 상용 파운데이션 모델을 그대로 활용하더라도 주변 오케스트레이션 및
거버넌스 레이어의 체계적인 회귀 테스트와 자동 진화만으로 기업 맞춤형 지능을 고도화할 수 있음을 입증했기 때문이다.
세일즈포스는 연구진이 활용한 에이전트 진화 실험 인프라인 '비글(Beagle)'을 아파치 2.0 라이선스 기반의
오픈소스로 깃허브(GitHub)에 공개해 생태계 확장에 나섰다.

원문 출처
- 매체명: VentureBeat
- 기사 제목: Salesforce researchers took an AI agent from finishing 43.5% of browser tasks to 93% without touching the model
- 작성자: Ben Dickson (2026년 9월 16일 발행)




