컨텍스트 압축 시 세션 제약 조건이 소리 없이 사라지는 문제 — COMPINT 평가 제안
Zhiqi Wang, Yichi Zhang, Dongwon Lee
컨텍스트 윈도우가 가득 찰 때 LLM 시스템이 이전 컨텍스트를 압축하는 과정에서, '이메일을 내가 확인할 때까지 삭제하지 마세요'와 같은 세션 제약 조건(Session Constraints, SC)이 조용히 유실되는 문제를 발견하고 정량화했다. 현재 압축기들은 평균 17%의 SC만 유지하며 대부분 압축 없이 실행하는 것보다 성능이 나쁜 것으로 나타났다. 연구팀은 멀티턴 채팅, 에이전트 궤적, 장기 리서치 등 세 가지 시나리오에서 압축기를 평가하는 COMPINT 벤치마크를 도입하고, 압축기나 LLM을 수정하지 않고도 90% 이상의 SC 보존율을 달성하는 SC 인식 추출기를 플러그인 모듈로 제안했다.
ArXiv cs.CLllmagentbenchmark
세그먼트 수준 자동 프롬프트 최적화(SAPO) — 프롬프트를 통째로 바꾸지 말고 부분별로 개선하라
Nikita Kulin, Viktor Zhuravlev, Artur Khairullin
기존 자동 프롬프트 최적화(APO)는 프롬프트 전체를 한 번에 재작성해, 한 부분을 개선하면 다른 부분이 나빠지는 문제가 있었다. 이를 해결하기 위해 프롬프트를 역할(role)·컨텍스트·태스크·출력 형식 네 세그먼트로 분해하고, 상위 5개·하위 5개 예시를 기준으로 각 세그먼트에 타깃 개선을 적용하는 SAPO 방법론을 제안했다. SQuADv2, TweetEval, XSUM, CommonGen, GSM8K 등 5개 벤치마크에서 APE, OPRO, EvoPrompt 등 강력한 기준선을 평균적으로 능가하는 성능을 GPT-3.5-Turbo와 GPT-4o-mini에서 각각 검증했다. 모듈화된 프롬프트 최적화가 전체론적 최적화보다 더 안정적이고 예측 가능한 개선을 가져온다는 것을 보여준 점에서 의미가 크다.
ArXiv cs.AIllmnlpbenchmark
멀티 LLM 에이전트 시스템의 동적 거버넌스 — 협력적 대화 결과를 위한 제어 이론 적용
Alexander Liss, Nicholas Desmond, Santiago Gil Gallego
서로 상충되는 목표를 가진 두 LLM 에이전트가 여러 턴에 걸쳐 상호작용할 때, 공유된 목표 함수 없이는 협력이 무너지고 대화가 실패로 끝나는 문제를 다뤘다. Experience Orchestrator(EO)라는 제어 이론 기반 거버넌스 레이어를 제안하며, 컨텍스추얼 밴딧(CB)·PID 컨트롤러·POMDP 신념 추적기 세 메커니즘으로 에이전트 간 궤적을 조율한다. 금융 서비스 시뮬레이션 환경에서 6만 번의 시뮬레이션을 통해 검증한 결과, 단순 LLM 제어 대비 고의도 어드바이저 접촉율을 46.1%에서 78.1%로 32%포인트 향상시켰다. 멀티 에이전트 시스템의 협력을 보장하기 위해 제어 이론을 도입한 접근법은 에이전트 오케스트레이션 분야에 새로운 설계 패러다임을 제시한다.
ArXiv cs.AIagentllmreinforcement-learning
세계 모델 연구를 위한 AI 코딩 에이전트 벤치마크 — AutoWorldModel-Bench
Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva
AI 코딩 에이전트가 자율적인 연구자처럼 세계 모델을 개선할 수 있는지 평가하는 폐쇄형 벤치마크 AutoWorldModel-Bench를 소개한다. 8개 게임 환경에서 통일된 구조적 상태 표현을 사용하며, 에이전트는 고정된 연산 예산 내에서 제공된 세계 모델 시작점을 자율적으로 개선한다. Codex-5.4와 Claude Opus 4.6은 64개 세션 중 63개에서 시작점보다 나은 결과를 달성했으며, 91%의 세션에서 하이퍼파라미터 조정이 아닌 새로운 목적함수·표현·아키텍처 변경 등 실질적인 연구 수준의 수정을 수행했다. AI 에이전트의 자율 연구 능력을 체계적으로 측정하는 새로운 벤치마크 패러다임을 제시한다.
ArXiv cs.AIagentbenchmarkcode-gen
확산 언어 모델(DLM)로 무손실 텍스트 압축 처리량 병목 극복하기
Angelo Nardone, Paolo Ferragina
LLM 기반 무손실 텍스트 압축은 zstd·gzip 등 범용 압축기 대비 월등한 압축률을 보이지만, 자동 회귀 방식의 심각한 처리량 한계로 실용화가 어렵다는 문제가 있다. 이를 해결하기 위해 자동 회귀 LLM 대신 확산 언어 모델(DLM)을 압축 파이프라인에 도입하는 방법을 최초로 제안한다. DLM은 한 번에 한 토큰씩 생성하는 자동 회귀의 제약을 받지 않아 병렬 생성이 가능하므로, 처리량 병목을 극복할 가능성이 있다. 무손실 압축에 DLM을 적용할 때 발생하는 알고리즘적 도전 과제들을 분석하고, 이를 해결하기 위한 접근법을 제시한다.
ArXiv cs.CLllminferencenlp