멀티 에이전트 시스템은 동시성 제어를 최우선 과제로 삼아야 한다
Xin Yang, Letian Li, Zimo Ji
이 포지션 페이퍼는 LLM 기반 멀티 에이전트 시스템(MAS)에서 에이전트 수를 늘릴수록 신뢰성이 오히려 저하되는 현상이 근본적으로 동시성 제어(concurrency control) 문제에서 비롯된다고 주장한다. 에이전트들이 공유 상태를 동시에 읽고 쓰는 상황에서, 긴 LLM 추론 윈도우가 낡은 읽기(stale reads), 갱신 손실(lost updates), 비일관성 등의 고전적 동시성 이상을 증폭시킨다는 것이다. 논문은 충돌 감지, 격리 보장, 공유 자원의 구조화된 접근 등 명시적 동시성 제어 메커니즘이 MAS 프레임워크의 1급 설계 요소가 돼야 한다고 강조한다.
LongNovel: 장문 소설 요약에서의 환각 탐지를 위한 멀티 스케일 벤치마크
Ruizhi Zhang, Jinwei Chen, Xiangju Lu
이 논문은 컨텍스트 윈도우가 크게 확장됐음에도 장문 맥락 요약에서 환각(hallucination) 문제가 여전히 심각하다는 점에서 출발해, 장편 소설 요약의 환각 탐지를 위한 멀티스케일 이중언어(중영) 벤치마크 LongNovel을 제안한다. 29개 중국 소설(1만 6천~10만 토큰)과 BookSum 데이터셋을 기반으로, 8가지 환각 유형을 설계하고 다중 모델 중재 및 개체 참조 기반 환각 생성 방식으로 데이터 품질을 확보했다. 컨텍스트가 길어질수록 환각이 어떻게 변화하는지를 체계적으로 분석한 최초의 대규모 벤치마크로, 긴 문서 요약 연구에 중요한 평가 기반을 제공한다.
4억 파라미터 언어 모델도 인간 수준 개체 추적 능력 보유 — 규모 가설 재검토
Karolina Drożdż, Micha Heilbron
이 연구는 언어 모델이 담화 전반에서 개체의 상태 변화를 추적하는 능력(entity tracking)이 언제부터 나타나는지를 인간 피험자 48명과 함께 자연스러운 서사문 기반으로 평가했다. 인간의 경우 서사 복잡도가 높아질수록 개체 추적 능력이 저하되지만, 언어 모델은 이미 4억 1천만 파라미터 규모에서 인간 수준의 능력을 보이며 규모가 커질수록 인간을 크게 능가하는 것으로 나타났다. 이는 기존 연구에서 수십억 파라미터 이상의 코드 특화 모델에서만 이 능력이 나타난다고 알려진 것과 대조적으로, 핵심 언어 이해 능력이 훨씬 작은 모델에서도 발현됨을 보여주는 중요한 발견이다.
컴파일러 피드백 기반 적응형 증명 탐색으로 Lean 4 정리 증명 성능 향상
Zhuo Liu, Ding Yu, Hangfeng He
이 논문은 실세계 Lean 4 프로젝트에서의 맥락 의존적 정리 증명을 위해 컴파일러 오류를 활용한 적응형 증명 탐색 프레임워크를 제안한다. 듀얼 모델 생성과 정체 시 재샘플링으로 다양한 시작점을 탐색하고, 컴파일러 기반 쌍별 비교를 통해 유망한 증명 상태를 집중 개선하는 방식을 결합했다. miniCTX-v2의 7개 실세계 Lean 4 프로젝트 실험에서, pass@32 예산 내에서 평균 통과율을 12.8%p 향상시키면서 LLM 호출을 21.9% 줄이는 효율-성능 트레이드오프 개선을 달성했다.
ArXivllmcode-genbenchmark
인도 언어를 위한 형태 구조 인식 토크나이저 SuTRA
Vaibhav Rathore, Siddhant Gole, Dadhichi Telwadkar
이 논문은 기존 서브워드 토크나이저가 통계적 압축만 최적화하고 형태론적 구조를 무시해, 힌디어·마라티어·구자라트어 등 형태적으로 풍부한 인도 언어에서 어근과 접사를 임의로 분리하는 '형태 분열(Morphological Shattering)' 현상을 일으킨다고 지적한다. 이를 해결하기 위해 akshara(음절) 단위 불가분성을 보존하고 형태 경계를 넘는 병합을 억제하는 형태 인식 토크나이저 SuTRA를 제안하며, 힌디·마라티·구자라트어 형태 분절 데이터셋도 함께 공개했다. SuTRA는 BPE 대비 형태 정렬(Boundary F1) +14.7%, 힌디어 의미 복원력 +34%, 기계번역 chrF2 평균 +8.08 향상을 달성해 저자원 언어 NLP의 실질적 개선을 이끌어낼 것으로 기대된다.
FinSkillBench: 투자 관리를 위한 AI 에이전트 금융 도메인 스킬 평가 벤치마크
Jermyn Zhen Yong Bek, Zhuang Qiang Bok, Zhongtian Sun
이 논문은 AI 에이전트가 투자 관리 분야에서 포트폴리오 구성, 리스크 관리, 기본 분석 등 실제 금융 작업을 수행하는 능력을 평가하는 FinSkillBench를 소개한다. 12개 서브태스크, 2,603개 에피소드로 구성된 이 벤치마크는 포인트인타임 데이터 조회, 정확한 계산 입력 조립, 특화된 방법 실행, 검증 가능한 구조화 출력 생성 등의 능력을 측정한다. 9개 모델 대규모 평가에서 큐레이션된 스킬 패키지 제공 시 평균 점수가 0.366에서 0.528로 향상됐으며, 에이전트가 자체 생성 스킬을 사용하는 조건에서는 성능이 오히려 저하되는 결과를 보여 스킬 설계의 중요성을 입증했다.