LoRA는 절차적 지식 학습에 실패한다: 멀티스텝 절차를 내재화하지 못하는 이유
Simon Dennis, Kevin Shabahang, Hao Guo
이 논문은 파라미터 효율적 파인튜닝 방법인 LoRA가 지시 따르기, 스타일 전이, 사실 적응 등에서는 성공하지만 조건 분기가 포함된 멀티스텝 절차적 지식 학습에서는 체계적으로 실패한다는 것을 실증한다. 여행 예약(14노드)과 줌 지원, 보험 청구(55노드) 등 세 가지 절차적 과제에서 r=16부터 128까지 모든 LoRA 설정이 태스크 성공률 2.54% 이하로 풀 파인튜닝(4.11%)에 크게 못 미쳤다. SVD 분석 결과 풀 파인튜닝이 만드는 가중치 변화는 저랭크 구조가 아니어서 LoRA의 저랭크 근사가 근본적으로 이 유형의 지식을 표현하지 못함을 밝혔다. 이는 복잡한 비즈니스 프로세스 자동화나 절차 기반 에이전트 파인튜닝에 LoRA를 사용하는 실무자들에게 중요한 경고다.
ArXiv cs.AIfine-tuningllmagent
AgentKVShift: 에이전틱 메모리 시스템을 위한 효율적 KV 캐시 재사용
Nilesh Prasad Pandey, Jason Kong, Lanxiang Hu
메모리 증강 LLM 에이전트는 수백 번의 상호작용에 걸쳐 컨텍스트를 유지하기 위해 요약, 키워드 등 메타데이터가 포함된 구조화된 메모리 유닛을 반복 재인코딩해야 하는데, 이것이 추론 비용의 지배적인 요인이 된다. 이 논문은 훈련 없이(training-free) 적용 가능한 KV 캐시 잔차 보정 방법인 AgentKVShift를 제안한다. 핵심 통찰은 메모리 유닛별 KV 재사용 잔차가 공유 오프셋과 소규모 토큰 변동으로 분해된다는 것으로, 소규모 프로브 세트로 오프셋을 추정해 전체 재사용 토큰을 효율적으로 보정한다. 기존 RAG용 KV 재사용 방법들이 에이전틱 구조화 메모리에서 성능이 떨어지는 문제를 해결해 장기 실행 에이전트의 추론 비용을 크게 줄일 수 있다.
ArXiv cs.AIagentinferencerag
FlowEvo: 워크플로우와 실행 가능 스킬의 공진화를 통한 자기 진화 에이전트
Zeyu Ren, Ling Yue, Ran Li
LLM 에이전트가 복잡한 태스크 해결 과정에서 발견한 유용한 절차를 휘발성 없이 재사용 가능한 스킬로 축적하는 훈련 불필요(training-free) 프레임워크 FlowEvo를 제안한다. 성공적인 실행 트레이스를 호출 가능한 아티팩트와 구조화된 가이던스가 쌍을 이루는 스킬 레코드로 컴파일해 스킬 뱅크에 저장한다. 워크플로우→스킬 컴파일, 스킬→워크플로우 피드백, 스킬 큐레이션(부정적 전이 억제)의 세 메커니즘이 결합돼 에이전트가 경험을 통해 지속적으로 향상된다. 기존 방식이 태스크 해결 후 유용한 프로시저를 버리는 반면, FlowEvo는 이를 체계적으로 미래 태스크에 활용해 누적 학습 효과를 달성한다.
HierFlow: 토폴로지와 실행의 계층적 결합 탐색을 통한 에이전틱 워크플로우 자동 합성
Dong Li, Yanchi Liu, Xujiang Zhao
LLM이 복잡한 문제를 해결하는 구조화된 워크플로우를 자동으로 생성하는 훈련 불필요 테스트 타임 프레임워크 HierFlow를 소개한다. 워크플로우 생성을 토폴로지(서브태스크 경계)와 실행(세부 최적화)이 상호 작용하는 계층적 탐색 문제로 개념화하고, 피드백 기반 토폴로지 조정과 MCTS 영감의 서브워크플로우 최적화를 결합한다. 맥락 필요성에 따라 실행 수준 탐색을 선택적으로 트리거하는 지능형 게이팅 모듈이 효율성을 극대화한다. 질의응답, 수학, 코딩 등 다양한 벤치마크에서 기존 자동 워크플로우 합성 방법을 능가하는 성능을 보인다.
FlowGuard: 내부 정보 분해를 통한 멀티모달 AI 보안
Jehyeok Yeon, Hyeonjeong Ha, Qiusi Zhan
멀티모달 LLM은 텍스트와 이미지에 악의적 의도를 분산시켜 단일 모달 방어를 우회하는 공격에 취약하다. 이 논문은 텍스트 전용 추론과 비전 전용 추론의 교차 모달 일관성을 탐지 신호로 활용하는 경량 추론 타임 프레임워크 FlowGuard를 제안한다. 부분 정보 분해(Partial Information Decomposition)에서 영감을 받은 FlowVectors를 통해 교차 모달 중복성, 시너지, 모달리티별 지배력을 정량화해 융합된 멀티모달 예측이 단일 모달 시맨틱 증거와 일치하는지 모니터링한다. 입력 또는 출력만 검사하는 기존 방어보다 내부 융합 과정을 직접 모니터링해 더 강건하고 계산 효율적인 방어를 달성한다.
ArXiv cs.AImultimodalsafetyvision
이기종 엣지 디바이스에서 LLM 스크리닝을 위한 전이 가능 지연 시간 예측 프레임워크
Xiaolong Tu, Vinod K. Mishra, Venkat R. Dasari
모바일·엣지 디바이스에서 LLM을 배포할 때 추론 지연 시간은 모델 아키텍처, 프롬프트 패턴, 런타임, 하드웨어 활용률, DVFS, 열 변화 등 수많은 요인에 영향을 받는다. 이 논문은 prefill/decode 단계를 분리하고 정적 서술자와 동적 하드웨어 텔레메트리를 게이팅 모델로 적응 융합하는 런타임 인식 지연 예측 프레임워크를 제안한다. Pixel 8·8 Pro, Jetson Nano, Orange Pi 5 Pro 등 이기종 디바이스에서 검증했으며, 특히 크로스 디바이스 전이에서 정적 기준선 대비 R² 0.966을 달성해 장치별 프로파일링 없이도 정확한 지연 예측이 가능함을 보였다.
ArXiv cs.AIinferencellmhardware
TILT: 모델 내재적 보상을 활용한 확산 모델의 구성적 생성 개선
Debottam Dutta, Jaehoon Hahm, Jianchong Chen
텍스트-이미지 생성 모델이 복잡한 구성 프롬프트(여러 개념의 동시 표현)에서 실패하는 문제를 훈련 없이 테스트 타임에 해결하는 TILT 프레임워크를 제안한다. 구성 실패를 결합 분포와 단일 개념 분포 간의 겹침 모드로 해석하고, 외부 감독이나 보상 모델 없이 베이스 모델 자체에서 추출한 내재적 보상을 활용한다. KL 제약 목적함수의 폐형 해(closed-form)로 기울기 유도 샘플링을 수행하며, T2ICompBench에서 기존 기준선 대비 이미지 품질을 유지하면서 구성 정렬 성능을 향상시켰다.
ArXiv cs.AIdiffusionvisiontraining