LLM 안전 회로 해부: 유해 탐지→안전 뉴런→거부 응답의 3단계 메커니즘
Kuan-Lin Chu, Chung-En Sun, Tsui-Wei Weng
이 논문은 LLM이 유해한 요청을 거부하는 내부 메커니즘을 기계적 해석 가능성(mechanistic interpretability) 관점에서 분석해 '안전 회로(Safety Circuit)'를 규명한다. 유해 입력에 반응하는 Harmful Detection Heads, 잔차 스트림에서 안전 신호를 안정화하는 Safety Neurons, 최종 거부 응답을 생성하는 Refusal Heads의 3단계 구조로 이루어진다. 가중치 스케일링이라는 간단한 기법으로 이 회로를 검증했으며, 여러 LLM 아키텍처와 적대적 공격 환경에서 이 구조가 반복적으로 나타남을 확인했다. 안전 정렬 메커니즘의 내부 작동 원리를 이해하고 개선하는 데 직접 활용할 수 있는 연구다.
UI-Venus-2: 모바일·웹·데스크톱을 아우르는 오픈소스 범용 GUI 에이전트
Venus Team (Zhuohan Cai et al.)
UI-Venus-2는 170개 이상의 다국어 모바일 앱과 네이티브 데스크톱 OS를 포함한 광범위한 환경에서 작동하는 범용 GUI 에이전트 모델이다. 환경(170+ 앱), 태스크(기능 기반 명령 생성), 검증(시각적 키포인트·다중 모델 투표 기반 RL 보상)의 세 가지 축을 동시에 확장해 실제 배포 격차를 줄였다. 안전 인식 메커니즘을 통해 위험한 액션의 통제된 실행도 지원하며, 전체 코드와 모델을 오픈소스로 공개해 GUI 에이전트 연구의 기반 모델로 활용될 수 있다.
ArXivagentmultimodalopen-source
OpenAgentFlow: 이기종 AI 에이전트 플리트를 위한 시스템 수준 안전 경계 구현
Dongsheng Chen, Xiangyu Zhao, Xin Yao, Xuetao Wei
OpenAgentFlow는 여러 AI 에이전트, 플래너, 컨트롤러가 동일한 사용자·기업 환경을 공유하는 멀티에이전트 시스템에서 액션 커밋 경계에서 안전을 강제하는 컨트롤 플레인/액션 플레인 아키텍처다. GUI 액션, API 호출, 도구 호출, LLM 생성 호출을 통합된 AgentEvent 스트림으로 정규화해 공유 정책 실행 포인트(PEP)를 통해 라우팅한다. 출처 추적, 세션 상태, 감사 기록, 업데이트 가능한 정책을 컨트롤 플레인에서 관리해 멀티에이전트 환경의 거버넌스와 감사 가능성을 크게 향상시킨다.
GUI-CC: 멀티스텝 환경으로서 GUI 월드 모델의 맥락적 일관성 벤치마크
Lin Fu, Zheyuan Yang, Tianhui Zhang, Jinbiao Wei
현재 GUI 월드 모델 평가는 단일 스텝 다음-화면 예측에 집중돼 있지만, 실제 사용 목적은 에이전트가 반복적으로 상호작용하는 멀티스텝 환경이다. GUI-CC는 이 불일치를 해소하기 위해 오프라인 참조-액션 트랙(500개 태스크)과 온라인 에이전트-루프 트랙(30개 앱, 200개 태스크)으로 구성된 벤치마크를 제시한다. 실험 결과, 그럴듯한 단일 스텝 생성 능력이 신뢰할 수 있는 환경 시뮬레이션을 보장하지 않으며, 현재 모델들은 태스크 관련 맥락 보존과 연속적 실행 지원에서 한계를 보임을 밝혔다.
ArXivagentbenchmarkmultimodal