STEP-KTODER: 함수 단위 실행 피드백으로 코드 선호도 최적화
Idris Nechnech, Sehwan Kim, Jungwoo Lee
이 논문은 코드 생성에서 프로세스 감독(process supervision)을 적용하기 위해 '단계'를 모듈 수준 함수로 정의하는 STEP-KTODER 프레임워크를 제안한다. 자동 생성된 유닛 테스트로 함수별 정확성 레이블을 부여하고, 함수 수준 프로세스 감독과 전체 프로그램 결과 피드백을 결합한 KTO를 적용한다. HumanEval, MBPP, BigCodeBench, LiveCodeBench에서 기존 KTO/DPO 대비 성능 향상을 보였으며, LLM 판사 어노테이션은 함수 실패를 과다 예측해 선호도 최적화를 오히려 저하시킨다는 것도 밝혔다. 코드 특화 강화학습에서 실행 기반 피드백의 중요성을 입증한 연구다.
ArXivcode-genreinforcement-learningfine-tuning
TRACE: 다목적 소재 발견을 위한 전이 인식 잔류 제어 프레임워크
Kang Zhou, Yujia Tong, Yong Tao
LLM 에이전트 기반 소재 발견에서 기존 방식은 평가된 후보와 점수만 저장해 '어떤 편집이 유용한 변화를 일으켰는지'를 추적하지 못한다. TRACE는 각 로컬 수정을 부모-편집-자식 전환으로 기록하고, 편집 효과를 추정해 미래 편집의 우선순위를 매기는 전이 인식 잔류 제어 프레임워크를 제안한다. 동일 백본 비교에서 TRACE는 최신 기준 모델 LLEMA의 18.13%에서 25.96%로 hit rate를 향상시켰다. 다중 목표가 경쟁하는 복잡한 과학 탐색 문제에서 에이전트의 효율을 높이는 핵심 기법을 제시한다.
ArXivagentreinforcement-learningllm
VIB-ICL: 멀티모달 인컨텍스트 학습에서 시각적 무시 문제 해결
Kaito Tanaka, Yuji Nishimura, Keisuke Matsuda
대형 비전-언어 모델은 멀티모달 인컨텍스트 학습(ICL)에서 시각적 데모를 완전히 무시하는 경우가 있는데, 그 이유가 명확하지 않았다. 이 논문은 정보 병목(Information Bottleneck) 원리를 기반으로 한 VIB-ICL 프레임워크를 제안하며, 교차 모달 정보 이득(CMIG)이 멀티모달 ICL의 일반화 오류를 결정한다는 것을 이론적으로 증명한다. 시각 정보가 텍스트와 중복될 때 시각적 무시는 최적 솔루션임을 수학적으로 도출했으며, 어텐션 재배분 원칙을 제시해 적응적 시각 어텐션 조정 방법을 제안한다. 멀티모달 LLM의 시각 활용 메커니즘을 이해하는 데 중요한 이론적 기여다.
ADE: 인간 중심 목표를 위한 에이전틱 데이터 진화 프레임워크
Yang Yu, Yilin Jiang, Aimin Zhou
인간 중심 목표에 맞게 LLM을 정렬하는 것은 비실행 가능하고 맥락 의존적인 타겟 때문에 검증과 감독이 어렵다. ADE는 합성 감독을 진화하는 데이터 스냅샷으로 조직화하고, OVS(관찰-변형-선택) 폐루프 절차로 데이터 품질을 지속적으로 향상시키는 프레임워크를 제안한다. DEV300에서 내재적 승률을 50%에서 75.81%, 외재적 승률을 55.20%에서 68.86%로 향상시켰으며, 전문가 블라인드 평가에서도 66.11% 선호도를 기록했다. 합성 데이터 생성에서 검증·선택으로 병목이 이동한 현실을 해결하는 실용적 접근법이다.
ArXivfine-tuningtrainingllm
ESQ-Bench: 엔터프라이즈 Oracle 환경의 NL2SQL 방언 일반화 벤치마크
Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik
기존 NL2SQL 벤치마크(Spider, BIRD)는 단순화된 학술 스키마와 오픈소스 SQL 방언만 사용해 실제 엔터프라이즈 환경을 반영하지 못한다. ESQ-Bench는 Oracle을 기본으로 하고 PostgreSQL, MySQL, SQL Server까지 포함한 465개 테이블, 164,682행 규모의 6개 스키마와 550개 검증된 질문-쿼리 쌍을 제공하는 새로운 기업급 벤치마크다. GPT-4o 실험에서 스키마 복잡도가 높아질수록 실행 정확도가 79.8→60.3→57.2%로 단조 감소했으며, 실행은 통과했지만 의미가 다른 '조용한 발산' 비율이 73~99%에 달했다. 실제 비즈니스 환경에서 NL2SQL 모델의 숨겨진 취약점을 드러내는 중요한 기여다.
LLM 에이전트, 시뮬레이션 모델로 통제된 실험 수행
Yuchen Xia, Michael Weyrich, Nasser Jazdi
과학·공학 문제에서 LLM은 텍스트와 코드 생성에는 강하지만 '개입에 따른 시스템 반응 이해', 즉 통제된 실험이 요구되는 과제에는 취약하다. 이 논문은 LLM 에이전트가 제약 제조 공정 설계를 위해 고품질 시뮬레이션 모델과 상호작용하며 통제된 실험을 수행하는 멀티에이전트 프레임워크를 제안한다. 시스템은 사용자 쿼리를 받아 실험을 설계·실행하고, 결과를 해석해 공정 파라미터 최적화 권고안을 생성한다. 언어 추론만으로는 불가능한 인과적 추론과 비교 실험을 에이전트로 실현하는 접근법으로 산업 AI 응용에 새로운 방향을 제시한다.