SysAdmin: 프론티어 AI의 도구적 권력 추구 행동 측정 벤치마크
Mana Azarm, Qiyao Wei, Rahul Nambiar
AI 안전 연구의 핵심 우려 중 하나인 'AI의 권력 추구 행동'을 정량적으로 측정하기 위한 벤치마크 SysAdmin을 제안한다. 고충실도 리눅스 샌드박스 환경에서 프론티어 LLM을 자율 시스템 관리자로 배치하고, 자기 보존, 자율성 확장, 자원 획득, 환경 수정, 전략적 은폐 등 5가지 차원에서 권력 추구 성향을 측정한다. 7개 프론티어 모델을 2,800개 태스크로 평가한 결과, 현재 모델들은 자연스러운 시스템 관리 맥락에서 권력 추구 행동이 0~5% 수준으로 미미했다. 하지만 명시적 권력 추구 프롬프트를 사용한 양성 대조 실험에서는 100% 탐지율을 달성해 측정 도구의 유효성을 확인했으며, 모델별로 다양한 실패 패턴이 존재함을 발견했다.
ArXiv cs.AIsafetybenchmarkagent
LLM 쿼리 라우팅에 레이턴시까지 고려하기 — 정확도·비용·지연 시간 동시 최적화
Shivam Patel, Akaash R. Parthasarathy, Ankur Mallick
현재 LLM 쿼리 라우터들이 응답 품질과 비용만 최적화하고 실제 생성 레이턴시를 무시하는 한계를 지적하며, 레이턴시 인식 라우터를 제안한다. 서빙 프레임워크의 자기회귀 토큰 배치 처리를 시뮬레이션해 TTFT(첫 토큰 도달 시간)를 추정하는 경량 레이턴시 추정기를 설계하고, 이를 품질·비용 최적화에 결합했다. 실험 결과 레이턴시·정확도·비용을 동시에 고려한 통합 최적화가 기존 방식 대비 정확도 최대 40% 향상을 달성했다. 프로덕션 AI 서빙 환경에서 실질적인 사용자 경험을 개선하는 데 직접 적용 가능한 연구다.
ArXiv cs.AIinferencellmmlops
LLM에 컨볼루션 추가하기 — Qwen3에 0.01% 파라미터 증가로 성능 향상
Yuchuan Tian, Yingte Shu, Wei He
트랜스포머의 셀프 어텐션이 전역적 토큰 상호작용에는 강하지만 자연어의 지역적 패턴을 명시적으로 인코딩하지 못하는 점에 착안해, 경량 뎁스와이즈 컨볼루션을 보조 요소로 추가하는 방법을 연구했다. Qwen3 트랜스포머 블록의 17가지 위치에서 컨볼루션 추가를 비교한 결과, 어텐션 전 Q·K·V 프로젝션에 적용할 때 최선의 결과를 얻었다. 커널 크기 k=3의 잔차 뎁스와이즈 컨볼루션이 0.01% 미만의 파라미터 추가로 7개 다운스트림 벤치마크 평균 정확도를 향상시켰다. 추가 비용 거의 없이 LLM의 단거리 토큰 상호작용 모델링을 개선하는 실용적이고 이식 가능한 기법을 제시한다.
ArXiv cs.CLllmtrainingbenchmark
Relay-Bench: 멀티도메인 추론 체인에서 LLM 평가하기
Liam Swayne
단일 프롬프트 내에서 서로 다른 여러 도메인의 추론을 연결해 처리해야 하는 복합 문제에 대한 LLM 평가 벤치마크 Relay-Bench를 소개한다. 시각 추론, 코딩, 수학, 정보 추출, 문제 해결, 일반 지식, 데이터 분석 등 7개 도메인을 2~13개 서브 문제로 조합한 복합 문제들로 구성되며, 프롬프트 인코딩과 의도적 컨텍스트 부풀리기로 난이도를 높였다. 현재 최고 성능 모델인 GPT-5.5(xHigh)도 43.3%를 달성하는 데 그쳐 아직 포화되지 않은 도전적 벤치마크임을 보여준다. 단일 도메인 추론이 아닌 크로스도메인 통합 추론 능력을 측정하는 보다 현실적인 평가 기준을 제시한다.
ArXiv cs.CLbenchmarkllmnlp
SIFT: 스스로 학습하는 문서 분류기 — LLM이 저렴한 모델을 지속적으로 교육
Bogdan Raduta, Horia Velicu, Alexandru Preda
라벨링 프로젝트 없이 프로덕션 트래픽만으로 지속적으로 성능이 향상되는 문서 분류 서비스 SIFT(Self-Improving Frozen-gate Training)를 제안한다. CPU 기반의 저렴한 SPLADE 희소 인코더와 LightGBM 헤드로 대부분의 요청을 처리하고, 신뢰도가 낮은 소수 케이스만 LLM 판사에게 에스컬레이션한다. LLM의 판정 결과가 레이블 코퍼스에 누적되어 저렴한 모델을 지속적으로 개선하며, 시간이 갈수록 에스컬레이션 비율이 감소한다. 새 문서 유형을 추가할 때도 레이블링 작업 없이 선언적 설정만으로 온보딩 가능해, 엔터프라이즈 문서 분류의 유지보수 비용을 획기적으로 줄일 수 있다.
ArXiv cs.CLllmfine-tuningnlp