AI 에이전트 하네스 최적화가 국내 자동화 사업자에게 주는 교훈
한 줄 요약
세일즈포스가 AI 모델 재학습 없이 에이전트 작업 방식만 개선해 브라우저 작업 성공률을 43.5%에서 93%로 끌어올린 연구 결과를 공개했다. 이는 국내 사업자가 AI 자동화를 도입할 때 모델 성능보다 프롬프트·도구·작업 흐름 설계에 먼저 집중해야 함을 보여준다. 특히 웹 작업과 고객 응대 자동화를 준비 중인 기업은 하네스 설계 단계부터 점검이 필요하다.
세일즈포스 AI 리서치가 2026년 9월 17일 공개한 연구에서 AI 모델의 가중치를 전혀 수정하지 않고도 에이전트의 브라우저 작업 성공률을 두 배 이상 높일 수 있다는 결과를 내놨다. 핵심은 모델 자체가 아니라 프롬프트·도구·제어 흐름 등 에이전트를 둘러싼 '하네스'를 진화시키는 방식이다. 이 접근은 국내에서 AI 자동화를 도입하려는 사업자에게 중요한 시사점을 준다.
AI 자동화 도입 시 모델보다 하네스를 먼저 점검해야 하는 이유는 무엇인가
모델 성능이 아니라 작업 수행 방식 설계가 실제 성공률을 결정하기 때문이다. 세일즈포스는 '다윈X'라는 프레임워크로 GPT-5.5 기반 에이전트의 웹 작업 성능을 43.5%에서 93%까지 끌어올렸다. 모델 재학습이나 가중치 변경 없이 프롬프트·도구 사용법·작업 순서만 반복 개선한 결과다.
국내 사업자가 챗봇이나 웹 자동화를 도입할 때 흔히 '더 좋은 모델'을 찾는 데 예산을 쓴다. 하지만 이번 연구는 같은 모델이라도 하네스 설계에 따라 성공률이 두 배 이상 벌어질 수 있음을 보여준다. 특히 고객 문의 응대·예약 처리·데이터 입력 같은 반복 작업을 자동화할 때는 모델 선택보다 프롬프트 구조와 도구 연결 방식이 더 큰 영향을 미친다. 현재 AI 자동화 성과가 기대에 못 미친다면 모델을 바꾸기 전에 하네스 설계를 먼저 점검해야 한다.
하네스 최적화는 구체적으로 무엇을 개선하는 것인가
프롬프트 문구·도구 호출 순서·작업 분기 조건·오류 재시도 규칙 등 에이전트가 작업을 수행하는 방식 전체를 가리킨다. 세일즈포스 연구진은 에이전트가 작업에 실패하면 원인을 분석해 여러 변형 하네스를 만들고 각각의 성능을 평가했다. 유용한 변화는 보존하고 다른 작업을 망가뜨리는 수정은 걸러내며, 서로 다른 변형의 장점을 결합하는 방식이다.
국내 사업자 관점에서는 세 가지 요소가 중요하다. 첫째, 프롬프트 구조다. 같은 요청이라도 단계별로 나눠 제시하는지, 예시를 포함하는지에 따라 결과가 달라진다. 둘째, 도구 연결 순서다. 여러 API나 데이터베이스를 호출할 때 어떤 순서로 어떤 조건에서 호출하는지가 성공률을 좌우한다. 셋째, 오류 대응 방식이다. 실패 시 재시도 횟수·대체 경로·사람 개입 시점을 어떻게 설정하느냐에 따라 전체 작업 완료율이 크게 바뀐다. 이 세 가지는 모델 성능과 무관하게 설계 단계에서 결정된다.
한 작업 개선이 다른 작업을 망가뜨리는 문제는 어떻게 해결하나
여러 변형을 동시에 유지하며 각 작업에 맞는 하네스를 선택하거나 결합하는 방식이 필요하다. 세일즈포스 연구진은 이를 '경로 의존성'과 '작업 간 간섭' 문제로 설명했다. 한 작업의 성능을 높이려고 프롬프트를 수정하면 다른 작업에서 오히려 성능이 떨어지는 경우가 생긴다. 다윈X는 하나의 하네스를 계속 수정하는 대신 여러 변형을 보관하고 각 작업에 적합한 후보를 선택한다.
국내에서 AI 자동화를 운영할 때도 같은 문제가 발생한다. 예를 들어 예약 취소 응대를 개선하려고 프롬프트를 바꿨더니 신규 예약 처리에서 오류가 늘어나는 식이다. 이를 막으려면 작업 유형별로 하네스를 분리하거나, 공통 부분과 전문 부분을 나눠 관리해야 한다. 또한 변경 전후 성능을 여러 작업에서 동시에 측정하는 체계가 필요하다. 세일즈포스 연구에서는 새롭게 해결한 작업에서 평균 수행 단계가 11회에서 22회로 늘었지만 기존 작업에서는 12회에서 13회로 소폭만 증가했다. 이는 에이전트가 작업 난이도를 구분해 대응하도록 하네스가 진화했음을 보여준다.
국내 사업자는 당장 무엇을 점검해야 하나
AI 자동화를 이미 운영 중이라면 현재 하네스의 성공률을 작업 유형별로 측정하고, 실패 원인을 분류해야 한다. 세일즈포스 연구는 모델 성능이 아니라 작업 수행 방식 설계가 성과를 결정한다는 점을 입증했다. 국내 사업자도 같은 원리를 적용할 수 있다.
먼저 현재 사용 중인 AI 자동화 시스템의 작업별 성공률을 측정한다. 고객 문의 응대·예약 처리·데이터 입력 등 작업 유형을 나누고 각각의 완료율·오류율·사람 개입 빈도를 기록한다. 다음으로 실패 사례를 분석해 프롬프트 문제인지, 도구 호출 순서 문제인지, 오류 처리 규칙 문제인지 분류한다. 그 뒤 우선순위가 높은 작업부터 하네스 변형을 만들어 테스트하고, 다른 작업에 미치는 영향을 함께 측정한다. 이 과정에서 모델 교체는 마지막 선택지로 둔다. 세일즈포스가 공개한 오픈소스 인프라 '비글'을 참고할 수도 있지만, 국내 환경에서는 자체 측정 체계를 먼저 갖추는 것이 현실적이다.
AI 자동화 도입을 준비 중이라면 모델 선택보다 하네스 설계에 시간을 더 투자해야 한다. 프롬프트 구조·도구 연결 방식·오류 대응 규칙을 작업 유형별로 설계하고, 파일럿 단계에서 여러 변형을 테스트할 계획을 세운다. 이번 연구 결과는 AI 자동화의 성과가 모델 성능보다 설계 품질에 더 크게 좌우된다는 점을 다시 한번 확인시켜 준다.
자주 묻는 질문
하네스 최적화를 외부 업체에 맡길 수 있나요
가능하지만 내부 측정 체계는 반드시 갖춰야 합니다. 하네스 설계는 업체가 해줄 수 있지만 작업별 성공률 측정·실패 원인 분류·우선순위 결정은 사업자가 직접 해야 정확합니다. 외부 업체는 설계 변형 제작과 테스트 자동화를 지원하는 역할로 활용하는 것이 적절합니다.
하네스 최적화에 얼마나 시간이 걸리나요
작업 복잡도와 측정 체계에 따라 다르지만 보통 2~4주 단위로 개선 효과를 확인할 수 있습니다. 세일즈포스 연구에서는 여러 변형을 동시에 테스트하는 방식을 사용했으므로 국내 사업자도 한 번에 하나씩 수정하기보다 여러 변형을 병렬로 실험하면 시간을 단축할 수 있습니다. 단 실패 사례가 충분히 쌓여야 원인 분석이 가능하므로 최소 100건 이상의 작업 로그가 필요합니다.
GPT-5.5 같은 최신 모델을 써야 하네스 최적화 효과가 나오나요
아닙니다. 이번 연구의 핵심은 모델 성능과 무관하게 하네스 설계가 성과를 결정한다는 점입니다. 오히려 구형 모델일수록 하네스 최적화로 얻는 성능 개선 폭이 클 수 있습니다. 국내에서 GPT-4 기반이나 한국어 특화 모델을 쓰고 있다면 모델 교체 전에 하네스 개선부터 시도하는 것이 비용 대비 효과가 높습니다.
원문 출처: AI타임스