https://arxiv.org/abs/2407.01502
AI Agents That Matter
AI agents are an exciting new research direction, and agent development is driven by benchmarks. Our analysis of current agent benchmarks and evaluation practices reveals several shortcomings that hinder their usefulness in real-world applications. First,
arxiv.org
1. 다른 평가지표를 고려하지 않는 좁은 관점
Sota는 지나치게 복잡하고 비용이 많이 들어 정확도를 얻는 데에 있어 결함이 있다.
우리는 두 가지 메트릭스를 고려하여 최적화하는 새로운 목적을 얻는 데에 목적이 있다.
정확도를 유지하는 반면 비용을 획기적으로 줄이는 최적화의 가능성을 보여줄 것이다.
2. 어떤 에이전트가 특정 어플리케이션에 적합한지 인지하기 어렵게 되어, 모델의 BenchMarking 요구사항과 밑단의 개발자가 융합될 것인다.
3. 많은 에이전트 벤치마크가 부적절한 제출 데이터 셋을 가지고 있다.-> 평가를 위한 데이터 자체가 잘못되었다?
다양한 방법으로 결함이 있고 오버피팅되어 있기 떄문에 부적절한 데이터 셋이 에이전트를 불완전하게 만든다.
4. 평가 실행에 있어 표준화에 결함이 만연한 재현성 부족으로 이어진다.
우리가 소개한 결함의 단계가 단순히 벤치마크의 정확도가 아닌 실생활의 에이전드의 개발에 있어 유용하게 사용되기를 희망한다.