papers

오늘의 논문

· 7건

2026.09.17 ArXiv의 주요 AI 논문 7건을 한국어로 요약했습니다. 오늘의 톱: 1.58비트 장벽을 넘다: 더 효율적인 3진법 LLM 양자화 · NeMo Data Designer: 멀티모달 합성 데이터 생성을 위한 확장 가능한 프레임워크 · EvolveTrade: 경험 기반 정책 개선으로 자기 진화하는 LLM 트레이딩 에이전트.

01
ArXiv·미공개

1.58비트 장벽을 넘다: 더 효율적인 3진법 LLM 양자화

이 논문은 LLM의 3진법(-1, 0, 1) 양자화에서 기존 1.58비트의 이론적 한계를 돌파하는 새로운 접근법을 제안한다. 3진법 양자화는 모델 크기를 획기적으로 줄이면서도 성능을 유지하는 핵심 기술인데, 이 연구는 기존 한계보다 더 압축된 표현을 가능하게 한다. 엣지 디바이스 배포나 추론 비용 절감을 목표로 하는 연구자들에게 중요한 이론적·실용적 기여를 한다. Hacker News에서 205점을 기록하며 양자화 연구 커뮤니티의 큰 관심을 받았다.

원문 읽기 ↗
02
ArXiv·Johnny Greco, Nabin Mulepati, Andre Manoel

NeMo Data Designer: 멀티모달 합성 데이터 생성을 위한 확장 가능한 프레임워크

NVIDIA의 NeMo Data Designer(NDD)는 텍스트, 코드, 구조화 출력, 이미지, 임베딩, 통계 샘플러 등 다양한 컬럼 유형을 지원하는 오픈소스 합성 데이터 생성 프레임워크다. 사용자가 데이터셋 컬럼을 선언적으로 정의하면 NDD가 의존성을 해결하고 모델 엔드포인트 호출을 스케줄링한다. 미리보기-수정 루프를 핵심 워크플로우로 내장해 소규모로 먼저 생성하고 확인한 뒤 전체 규모로 확대하는 반복적 SDG 프로세스를 지원한다. 파인튜닝 데이터 부족 문제를 합성 데이터로 해결하려는 ML 실무자들에게 즉시 활용 가능한 도구다.

원문 읽기 ↗
03
ArXiv·Sehee Kim, Yumin Choi, Minki Kang, Sung Ju Hwang

EvolveTrade: 경험 기반 정책 개선으로 자기 진화하는 LLM 트레이딩 에이전트

EvolveTrade는 LLM 트레이딩 에이전트의 시스템 프롬프트를 텍스트 파라미터화된 정책으로 취급하고, 누적된 거래 결정 이력과 포트폴리오 피드백을 기반으로 정책을 자동 개선하는 프레임워크다. 백본 LLM을 고정한 채 정책만 업데이트하므로 재학습 없이 시장 환경 변화에 적응할 수 있다. 여러 시장 국면과 두 가지 LLM 백본에서 샤프 비율과 누적 수익률이 고정 정책 기준선보다 향상됐음을 실험으로 보였다. 시스템 프롬프트 자체를 학습 가능한 정책으로 활용하는 새로운 에이전트 자기 개선 패러다임을 제시한다.

원문 읽기 ↗
04
ArXiv·Sikun Wang, Yixi Zhou, Lei Fan, Fan Zhang

GraphEcho: LLM 그래프 에이전트의 구조적 중복과 증거 출처 문제

GraphEcho는 LLM 에이전트가 그래프 탐색 중 서로 다른 경로를 통해 같은 증거를 반복 조우할 때 이를 추가적인 증거 확인으로 착각하는 문제를 연구한다. 경로 수와 증거 출처를 독립적으로 조작하는 벤치마크를 통해, 중복 경로가 에이전트의 반복 탐색을 증가시킴을 실험적으로 확인했다. 출처 인식 사후 학습(PAPT)이 반복을 줄이지만 고유 소스 커버리지는 감소시키는 트레이드오프도 발견됐다. 그래프 기반 RAG와 지식 그래프 에이전트 설계에 중요한 시사점을 제공하는 연구다.

원문 읽기 ↗
05
ArXiv·Marco Simoni, Aleksandar Fontana, Giulio Rossolini, Andrea Saracino

DANTINOX: 자기회귀·이산 마스크 확산·연속 플로우 매칭을 통합하는 언어 모델링 프레임워크

DantinoX는 하나의 모듈식 Transformer 백본으로 자기회귀 디코딩, 이산 마스크 확산, 연속 플로우 매칭 세 가지 생성 패러다임을 모두 지원하는 JAX/Flax 기반 오픈소스 라이브러리다. 생성 패러다임, 어텐션 메커니즘, 하드웨어 토폴로지를 설정 변경만으로 전환할 수 있어, 동일한 코드베이스에서 패러다임 간 공정한 비교 실험이 가능하다. 기존에는 각 패러다임이 별도 코드베이스에 존재해 성능 차이가 구현 차이 때문인지 패러다임 차이 때문인지 구분하기 어려웠던 문제를 해결한다.

원문 읽기 ↗
06
ArXiv·Dingli Liang, Yiqiao Xie, Yukai Huang

CapMem: 자기중심 영상에서 캡션 기반 에피소드 메모리 벤치마크

CapMem은 웨어러블 AI 어시스턴트를 위한 에피소드 메모리 연구를 위해, 총 33.7시간의 75개 영상과 16개 시나리오에 걸친 1,000개의 객관식 질문으로 구성된 벤치마크다. 텍스트 캡션을 재사용 가능한 에피소드 메모리로 활용하는 것이 직접 VideoQA보다 효과적임을 보였으며, 특히 20분 이상의 긴 영상에서 캡션 기반 접근법이 12개 모델 중 10개에서 우수한 성능을 보였다. 캡션 유도 검색-검증 방식이 정확도를 최대 5.3포인트 향상시켜, 장기 자기중심 비디오 추론에서 캡션 메모리의 효과를 입증했다.

원문 읽기 ↗
07
ArXiv·Victoria Popa, Guglielmo Cola, Caterina Senette, Maurizio Tesconi

LLM이 다크 트라이어드 성격 특성을 의도적으로 숨기거나 과장할 수 있다

이 연구는 현대 LLM들이 취업 면접과 법의학적 평가라는 두 가지 맥락에서 마키아벨리즘, 나르시시즘, 사이코패시 등 다크 트라이어드 성격 특성을 상황에 따라 체계적으로 조절할 수 있음을 보였다. 7개의 최신 모델을 평가한 결과, 대부분의 모델이 '좋은 인상'을 줘야 하는 상황에서는 다크 트라이어드 점수를 낮추고, '나쁜 인상'을 줘야 하는 상황에서는 높이는 패턴을 보였다. LLM이 인격 평가에서 인간처럼 인상 관리 행동을 보인다는 점은 AI 안전성과 신뢰성 연구에 중요한 시사점을 가진다.

원문 읽기 ↗