AREX-2: 장기 반성적 태스크를 통한 자기 개선 에이전트 발전
Hongjin Qian, Chaofan Li, Kun Luo
테스트 시간에 에이전트가 스스로 솔루션을 반복 개선하는 '자기 개선(self-improving)' 능력을 향상시키는 방법을 제안한다. 검증 가능한 피드백이 있는 머신러닝 및 알고리즘 프로그래밍 과제에서 장기 개선 궤적을 합성해 학습 데이터로 활용하며, Qwen3.8-27B 기반으로 MLE-bench Lite 81.8, GAIA 92.2 등 강력한 성과를 달성했다. 반성(reflection)과 장기 실행(long-horizon execution)이라는 두 가지 보완적 능력이 도메인에 무관하게 학습 가능함을 보여줬다.
ArXiv cs.AIagentreinforcement-learningllm
MoFlow: 다목적 에이전트 워크플로우 생성
Yining Lu, Aurelie Lozano, Yu Deng
정확도, 비용, 지연, 강건성 등 여러 목표를 동시에 최적화하는 에이전트 워크플로우를 생성하는 MoFlow를 제안한다. 기존 방법들이 단일 가중합으로 고정된 트레이드오프를 학습해야 했던 한계를 극복하기 위해, Convex-Hull Monte Carlo Tree Search를 활용해 단일 탐색으로 파레토 프런트 전체를 근사한다. 수학, 코드, QA 6개 벤치마크에서 6개 기준선을 상회하며, 선호도 변경 시 재훈련 없이 워크플로우를 즉시 반환할 수 있다.
ArXiv cs.AIagentreinforcement-learningbenchmark
정렬된 데이터도 컨텍스트 혼동을 통해 오정렬을 유발할 수 있다
Yavuz Bakman, Duygu Nur Yaldiz, Baris Askin
정렬(aligned) 학습 데이터로 파인튜닝해도, 해당 데이터가 다른 컨텍스트에서는 부적절한 행동을 유발할 수 있다는 '컨텍스트 혼동(context confusion)' 현상을 발견했다. 성 평등, 프라이버시, 신체 안전 3개 도메인에서 이 현상을 실증적으로 보여주며, 일반적인 정렬 데이터 주입으로는 이 문제가 해결되지 않음을 확인했다. 특정 컨텍스트에 맞게 정렬된 데이터가 다른 컨텍스트에서는 오히려 역효과를 낼 수 있다는 점에서, 기존 안전 학습 방법론의 근본적 한계를 지적한다.
ArXiv cs.AIsafetyfine-tuningllm
정렬 예측: 학습 데이터에서 오정렬을 사전에 예측하기
Chen Yueh-Han, Bruce W. Lee, Ilia Sucholutsky
파인튜닝 이후가 아니라 훈련 전에 데이터셋이 모델을 오정렬시킬 가능성을 예측하는 '정렬 예측(Alignment Forecasting)' 태스크와 벤치마크 ALIGNMENTFORECASTBENCH를 제안한다. 17개 모델, 32개 데이터셋, 16개 실패 모드에 걸쳐 5,000개 이상의 예측 질문을 포함하며, LLM이 데이터셋을 읽고 오정렬 강도를 평가하는 스캐폴드 방식으로 프런티어 모델 직접 프롬프팅보다 훨씬 높은 예측 정확도를 달성했다. 사후 감사(post-hoc audit)를 보완하는 사전 예방적 안전 도구로서의 가능성을 열어준다.
ArXiv cs.CLsafetyfine-tuningbenchmark
Sieve and Sage: RAG 추론 실패를 효율적으로 걸러내는 이단계 프레임워크
Jongbin Won, Sung Geun An, Jay-yoon Lee
RAG(검색 증강 생성) 시스템에서 검색 실패를 두 가지 상태(답변 불가·산만한 정보 혼재)로 분리하고, 경량 Sieve 모듈이 방해 문서를 먼저 필터링한 뒤 무거운 LLM(Sage)이 생성을 수행하는 이단계 아키텍처를 제안한다. 단일 LLM 기반 기준선 대비 정확도 최대 69.4%p, Macro-F1 최대 55.2%p 향상을 달성했으며 처리 속도도 최대 1.99배 빨라졌다. RAG 시스템의 추론 실패 처리를 분리 모듈로 효율화할 수 있음을 보여주는 실용적 연구다.
ArXiv cs.CLragllminference
GFlowNet으로 모드 붕괴를 넘어 다양한 합성 전문가 대화 생성하기
Sumit Asthana, Michael Ion, Kevyn Collins Thompson
LLM 후훈련(post-training)을 위한 합성 데이터 생성 시 발생하는 다양성 부족(모드 붕괴) 문제를 Generative Flow Networks(GFlowNets)로 해결하는 방법을 제안한다. 대화 구조의 잠재 표현을 가우시안 혼합 밀도로 모델링해 훈련 데이터의 전문가 전략 분포에 비례하게 샘플링함으로써, 튜터링·감정 지원 대화 두 도메인에서 RL 기반 및 end-to-end LLM 기준선보다 충실도·모드 커버리지·자연스러움 모두에서 우수한 성과를 달성했다. 다양한 합성 데이터 생성이 LLM 파인튜닝 품질에 직접적 영향을 준다는 점에서 실용적 의의가 크다.
ArXiv cs.AItrainingfine-tuningllm