AutoFyn: 장기 에이전트를 위한 비파라메트릭 전문가 반복 학습
Adib Hasan, Daniel Schaffield, Akashnil Dutta
AutoFyn은 모델 가중치를 업데이트하지 않고 영구적 상태(메모리 파일, 보고서, 저장소 상태)를 통해 에이전트를 여러 라운드에 걸쳐 개선하는 프레임워크다. Expert Iteration 알고리즘에서 영감을 받아, 검증된 보상 신호를 영구 상태에 반영해 다음 라운드의 효과적인 정책을 업데이트한다. 2026 국제수학올림피아드(IMO) 6개 신규 문제에서 개선 여지가 있는 모든 모델이 AutoFyn 적용 후 자체 코딩 에이전트보다 높은 점수를 기록했다. 올림피아드 수학, 데이터 과학, 사이버보안 등 세 도메인에서 효과가 검증되어 장기 에이전트 학습의 실용적 대안으로 주목된다.
ArXivagentreinforcement-learningbenchmark
MERIT: 도구 사용 LLM 에이전트에서 장기 메모리가 실제로 도움이 되는가
Shweta Mishra, Shashank Mishra
기존 장기 메모리 벤치마크가 대화 회상만 측정하는 반면, MERIT는 도구 사용 에이전트가 실제 태스크를 수행할 때 메모리가 얼마나 유용한가를 비용까지 포함해 측정한다. 23,440개 에피소드 실험 결과, 메모리는 의존적 태스크 성공률을 0.00에서 0.55-1.00으로 끌어올렸다. 그러나 업데이트된 사실에 대한 임베딩 기반 검색은 0.30-0.95로 불안정하고, 올바르게 검색된 값을 에이전트가 실제로 활용하는 비율도 55%에 그쳐 장기 메모리의 신뢰성 문제를 명확히 드러냈다. 에이전트 메모리 설계 시 고려해야 할 실질적 한계를 제시하는 중요한 평가 연구다.
RAG 파이프라인이 강할수록 쿼리 재작성의 효과는? 상호 보완성이 핵심
Sara Shanian, Xiaoqin Yi, Pavlo Ruban
이 논문은 강력한 RAG 파이프라인(BGE 밀집 검색, 크로스 인코더 리랭킹, MMR 다양화) 위에서 쿼리 재작성이 실제로 도움이 되는지 체계적으로 검증했다. 단일 재작성 전략은 강력한 베이스라인과 엇비슷한 수준이지만, 여러 전략을 결합하면 서로 다른 질문에서 실패를 보완해 HIT@10이 최대 13.8 포인트 향상됐다. 엔터프라이즈 RAG 벤치마크에서 4개 방법 조합(S1+S3+S4+HyDE)이 51.70 vs 39.22로 큰 격차를 보였으며, 이는 검색 예산이 아닌 방법 간 상호 보완성이 핵심 원동력임을 증명했다.
SciLitBench: LLM 기반 체계적 문헌 검토 평가 벤치마크
Miguel Zabaleta, Baihan Lin
SciLitBench는 제목·초록 스크리닝, 전문 스크리닝, 스키마 기반 데이터 추출 등 체계적 문헌 검토의 전 단계를 아우르는 다단계 벤치마크로, 42,981개 레코드와 1,012개 전문을 포함한다. 22개 오픈 LLM 실험 결과, 명시적 포함·제외 기준 제공 시 F2가 28.8% 향상됐고, 연구자 작성 근거 제공 시 전문 스크리닝이 15% 개선됐다. 그러나 데이터 추출에서는 최강 모델도 평가 근거의 30%, 한계점의 25%만 회수해, LLM 보조 증거 합성의 실용적 한계를 명확히 드러냈다.
손상 인식 밴딧 가지치기: 비전·언어 트랜스포머를 더 효율적으로
Salem Ameen, Sunil Vadera
이 논문은 트랜스포머의 구조적 포스트 트레이닝 가지치기를 다중 슬롯 머신 문제(multi-armed bandit)로 정형화해, 제한된 평가 예산 내에서 성능 손상이 최소화되는 유닛을 선택한다. 어텐션 헤드와 MLP 채널 그룹을 캘리브레이션 배치에서 임시 마스킹해 손상을 측정하고, UCB 또는 Thompson Sampling 정책으로 최적 유닛을 선별한다. GPT-2, OPT, Qwen2.5, ViT-B/16 등 다양한 모델에서 랜덤·크기 기반·탐욕 기반 선택 대비 우수한 성능을 보여, 추론 효율화를 위한 실용적 가지치기 전략을 제시한다.
ArXivquantizationinferencellm
LLM의 2차적 사회 추론 평가: 사회 규범 위반에 어떻게 반응하는가
Sunny Rai, Jinyi Kuang, Reyhan Jamalova
기존 AI 정렬 연구는 '도둑질하지 말라'는 1차적 사회 규범에 집중해왔지만, 이 논문은 규범 위반 시 사람들이 어떻게 반응할지 예측하는 2차적 메타규범(metanorm) 추론 능력을 평가한다. 450개 규범 위반 시나리오로 구성된 NormReact 데이터셋을 공개하고, 6개 LLM 모델을 테스트한 결과 모든 모델이 인간보다 부정적 제재를 과도하게 예측하고 사회적 거리가 멀어질수록 인간 판단과의 일치도가 떨어지는 것을 발견했다. LLM이 실제보다 더 가혹한 사회를 묘사하는 경향이 있음을 보여주며, 사회 인식 AI 시스템 개발에 중요한 시사점을 제공한다.