BPE 토크나이제이션이 만드는 LLM 안전 정렬의 허점
Tung-Ling Li, Hongliang Liu, Yuhao Wu
현대 LLM에서 사용하는 BPE 토크나이저가 안전에 중요한 단어를 서브워드로 분절함으로써 안전 정렬을 우회할 수 있다는 구조적 취약점을 밝혔다. 5개 모델 패밀리 실험에서 이 공격이 거부 프롬프트의 80~100%를 무력화했고, 그 중 48%가 실제 유해 출력을 생성했다. 공개된 정렬 데이터셋 3만 개 예시 중 분절된 입력은 전혀 없어, 현재 안전 훈련 데이터에 이 취약점이 반영되지 않았음을 확인했다. LLM 안전 연구와 레드팀 방법론 전반의 재검토를 요구하는 중요한 발견이다.
CreativityNeuro: 가중치 조정으로 LLM의 발산적 사고를 높이고 모드 붕괴를 줄이는 방법
Samuel Schapiro, Core Francisco Park, Felix Sosa, Lav R. Varshney
LLM이 개방형 질문에 반복적으로 유사한 답변을 생성하는 '인공 군집 사고' 현상을 해결하기 위해, 데이터 없이 대조적 가중치 조정으로 창의성을 향상시키는 CreativityNeuro를 제안한다. 발산적 연상 테스트(DAT)에서 인간 백분위 기준 최대 14점 향상을 달성했으며, 720명 대상 인간 평가에서도 독창성·놀라움·창의성이 유의미하게 개선됐다. 활성화 조정 대비 가중치 공간 조정이 더 긴 형태의 개방형 과제에서 우위를 보임을 실증했다. LLM의 창의적 응용과 다양성 향상에 실질적 기여를 할 수 있는 연구다.
의료 영상 보고서 초안 작성을 위한 이산 확산 언어 모델
Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert
텍스트를 좌에서 우로 생성하는 자기회귀(AR) 방식 대신 토큰 캔버스를 양방향으로 디노이징하는 확산 언어 모델을 의료 영상 보고서 작성에 적용했다. MoE 확산 모델 DiffusionGemma-26B를 동일 LoRA 레시피로 파인튜닝한 결과, 의료 VQA 데이터셋에서 AR 모델과 동등하거나 더 나은 성능을 보이면서 디코딩 속도는 3.5~4.4배 빠르다. 핵심 차별점은 양방향 디노이징의 특성을 활용한 '임의 위치 채우기(any-order infill)'로, 방사선과 의사가 보고서 일부를 고정하면 모델이 나머지를 채워주는 인터랙티브 초안 작성 워크플로를 구현한다. 의료 AI에서 확산 모델이 AR을 실질적으로 대체할 수 있음을 보여주는 연구다.
ArXivdiffusionmultimodalnlp
절차적 메모리 증류: 훈련 중 자기 개선을 위한 온라인 반성 학습
Ye Liu, Srijan Bansal, Bo Pang
RLVR(검증 가능한 보상을 이용한 강화학습) 훈련에서 개별 에피소드의 신호만 활용하는 한계를 극복하기 위해, 에피소드를 가로질러 축적되는 절차적 정보를 재사용 가능한 메모리로 변환하는 PMD(Procedural Memory Distillation)를 제안한다. 메모리는 원시 궤적, 자기 반성 전략과 교훈, 반복 패턴의 3단계 추상화로 구성되며, 훈련 중 모델 자신의 궤적에서 온라인으로 추출된다. 이 메모리는 학습의 발판으로만 사용되고 추론 시에는 메모리 없이 동작하는 모델로 수렴한다. 에이전트의 지속적 자기 개선 메커니즘을 훈련 과정에 내재화하는 새로운 접근이다.
ArXivreinforcement-learningagenttraining
Wiola: 기존 모델 계보 없이 처음부터 설계한 독자적 소형 언어 모델 아키텍처
Aryuemaan Kumar Chowdhury, Afreen Shaik, Yaparla Bhargavi
GPT, LLaMA, Mistral, Falcon 등 기존 모델 구조와 무관하게 완전히 새로운 원리로 설계한 소형 언어 모델(SLM) 아키텍처 Wiola를 제안한다. 핵심 혁신으로 3D 나선형 위치 인코딩(SRPE), 계층 간 게이팅 어텐션(GCLA), 적응형 토큰 병합(ATM), 이중 스트림 피드포워드(DSFF), WiolaRMSNorm 등 5가지 독립적 신규 구성 요소를 도입했다. 각 컴포넌트의 완전한 수학적 유도와 아키텍처 블록 다이어그램을 함께 제공한다. 기존 모델 계보에 의존하지 않는 독자적 SLM 아키텍처 연구로 소형 모델 설계 다양성을 넓히는 데 기여한다.
ProvenanceGuard: 출처 분석으로 LLM 에이전트의 정렬 이탈 행동을 차단
Yining She, Yiliang Liang, Eunsuk Kang
LLM 에이전트가 사용자 의도와 다른 도구를 호출하는 '정렬 이탈(misalignment)' 문제를 해결하기 위해, 출처 분석(provenance analysis)을 기반으로 한 다단계 가드레일 시스템 ProvenanceGuard를 제안한다. 제안된 프레임워크는 에이전트의 도구 호출이 컨텍스트 내 추적 가능한 증거로 뒷받침되는지를 검증하며, LLM-as-a-judge 방식의 불일관성과 감사 불가 문제를 극복한다. Agent-SafetyBench와 WorkBench 두 벤치마크에서 10개 백본 LLM에 걸쳐 평가해 효과를 입증했다. AI 에이전트의 프로덕션 배포 안전성을 높이는 실용적 가드레일 설계 방법론을 제시한다.
Agent4cs: 대형 계층적 코드베이스를 위한 멀티에이전트 코드 요약 시스템
Yongjian Tang, Ezgi Sarikayak, Doruk Tuncel
난독화된 구조와 불완전한 문서를 가진 대규모 코드베이스를 이해하기 위해, 하위에서 상위로 올라가는 방식의 멀티에이전트 코드 요약 프레임워크 Agent4cs를 제안한다. 요약 에이전트, 키워드 추출 에이전트, 품질 보증 에이전트의 세 역할이 협력하며, 코드를 평면 텍스트가 아닌 계층적 구조로 처리한다. 7개 최신 모델에 평가한 결과 기존 구조화 프롬프팅 대비 평균 8% 의미적 일관성 향상, 실제 데이터셋에서 키워드 커버리지 최대 38% 향상을 달성했다. 레거시 코드나 대형 엔터프라이즈 코드베이스 분석에 실질적으로 적용 가능한 연구다.