AI Today
오후 에디션
오후 7시AI Weather
Microsoft-OpenAI 독점 계약 종료와 Cursor AI 요금제 변경으로 AI 생태계 지각변동이 일고, 오픈소스 코딩 에이전트가 급부상하는 하루.
오전 에디션
오전 7시AI Weather
MS-OpenAI 독점계약 종료와 DeepSeek V3 급부상 속에서, AI 에이전트 보안 취약점이 주목받는 하루.
AI Weather
Microsoft-OpenAI 독점 계약 종료와 Cursor AI 요금제 변경으로 AI 생태계 지각변동이 일고, 오픈소스 코딩 에이전트가 급부상하는 하루.
AI Weather
MS-OpenAI 독점계약 종료와 DeepSeek V3 급부상 속에서, AI 에이전트 보안 취약점이 주목받는 하루.
마이크로소프트와 OpenAI가 5년간의 독점 파트너십과 매출 공유 계약을 종료했다고 블룸버그가 보도했습니다. 이는 AI 업계 생태계의 근본적 변화를 의미하며, 두 기업 간 관계 재정립과 함께 AI 시장 경쟁 구도에 큰 영향을 미칠 전망입니다.
GitHub가 Copilot의 요금 체계를 기존 구독형에서 실제 사용량에 따른 종량제로 변경한다고 발표했습니다. 이는 AI 코딩 도구 시장의 가격 경쟁이 본격화되고 있음을 보여주며, 개발자들에게는 더 유연한 비용 구조를 제공할 예정입니다.
OpenAI가 ChatGPT Enterprise와 OpenAI API에 대해 FedRAMP Moderate 인증을 획득했다고 발표했습니다. 이를 통해 미국 연방정부 기관들이 보안 요건을 충족하면서 AI 서비스를 안전하게 도입할 수 있게 되었으며, 정부 시장에서의 AI 채택이 가속화될 것으로 예상됩니다.
구글이 Kaggle과 함께 5일간의 AI 에이전트 집중 코스를 새롭게 출시한다고 발표했습니다. 이 코스는 'Vibe Coding' 방식으로 AI 에이전트 개발의 실무적 접근법을 교육하며, AI 에이전트 개발자 양성에 대한 구글의 전략적 투자를 보여줍니다.
구글이 Chrome 브라우저에 Prompt API를 공식 도입한다고 발표했습니다. 이를 통해 웹 개발자들은 별도의 외부 API 없이도 브라우저에서 직접 AI 기능을 활용할 수 있게 되어, 웹 애플리케이션의 AI 통합이 획기적으로 간소화될 전망입니다.
카카오모빌리티가 물리적 AI 전략의 일환으로 레벨 4 자율주행 기술을 자체 개발하겠다는 계획을 발표했습니다. 김진규 부사장은 실제 도로 환경에서의 AI 적용을 통해 완전 자율주행 달성을 목표로 한다며, 한국 자율주행 기술의 독자적 발전 가능성을 제시했습니다.
연매출 1,550만 달러의 라이텔리전스가 상장 첫날 시가총액 100억 달러를 기록하며 400% 급등했습니다. 투자자들은 AI 인프라의 다음 병목점이 광학 인터커넥트가 될 것이라 전망하며, 이 분야의 기술적 돌파구가 AI 발전의 핵심 요소로 부상하고 있습니다.
구글 연구팀이 악성 웹페이지들이 간접 프롬프트 주입을 통해 기업용 AI 에이전트를 공격하고 있다고 경고했습니다. Common Crawl 데이터베이스를 조사한 결과, 수십억 개의 웹페이지 중 상당수가 AI 에이전트를 표적으로 한 숨겨진 악성 명령어를 포함하고 있어 AI 보안의 새로운 취약점이 드러났습니다.
엔비디아가 물리학 정보를 활용한 적응형 초음파 영상 AI 'Raw2Insights-US'를 허깅페이스를 통해 공개했습니다. 이 AI는 의료 영상의 품질을 실시간으로 최적화하며, 물리학적 원리를 AI에 통합한 새로운 접근법으로 의료 AI의 정확성과 신뢰성을 크게 향상시킬 것으로 기대됩니다.
MIT 테크 리뷰가 DeepSeek의 새로운 모델 V3가 AI 업계에 미치는 영향을 3가지 관점에서 분석했습니다. 중국 AI 기업의 기술적 도약, 오픈소스 모델의 상업적 위협, 그리고 글로벌 AI 경쟁 구도의 변화가 주요 포인트로, DeepSeek V3가 AI 시장의 판도를 바꿀 수 있는 잠재력을 지녔다고 평가했습니다.
개발자가 직접 제작한 오픈소스 AI 에이전트 'dirac'이 구글의 Gemini-3-flash-preview 모델에서 TerminalBench 벤치마크 1위를 기록했다고 발표했습니다. 터미널 작업 자동화에 특화된 이 에이전트는 기존 상용 솔루션들을 뛰어넘는 성능을 보여주며, 오픈소스 AI 도구의 가능성을 입증했습니다.
한 개발자가 Cursor AI의 수익 모델에 대해 의문을 제기하며 커뮤니티의 활발한 토론을 이끌어냈습니다. OpenAI API 비용 대비 Cursor의 저렴한 가격정책이 어떻게 지속 가능한지에 대한 분석과 함께, AI 코딩 도구 시장의 경쟁 전략에 대한 다양한 견해가 나오고 있습니다.
HNSW(Hierarchical Navigable Small World) 알고리즘이 어떻게 대규모 벡터 검색의 확장성 문제를 해결했는지 자세히 설명한 글입니다. 기존 방법들의 한계와 HNSW의 혁신적 접근법을 통해 수십억 개의 데이터에서도 밀리초 단위의 검색이 가능해진 원리를 개발자 친화적으로 설명하고 있습니다.
AI 특화 데이터베이스 개발자가 자신의 프로젝트를 프로덕션 환경에 배포하기까지 필요했던 3가지 결정적 기능에 대해 설명합니다. 벡터 검색 최적화, 메모리 관리, 그리고 확장성 개선이 핵심이었으며, 실제 운영 환경에서의 경험을 바탕으로 한 실용적인 인사이트를 제공합니다.
AI 에이전트 OpenClaw의 개발자가 사용자들이 시간이 지날수록 더 자연스럽고 인간적인 상호작용을 경험하는 이유를 분석한 글입니다. 적응형 학습과 맥락 이해 능력의 점진적 향상이 핵심 요소로, AI 에이전트의 사용자 경험 설계에 대한 새로운 관점을 제시합니다.
하네스 엔지니어링 실습을 통해 완전 자동화된 6개 AI 에이전트 시스템을 구축한 경험을 상세히 공유한 글입니다. 각 에이전트의 역할 분담, 상호 통신 방식, 그리고 장애 처리 메커니즘까지 실제 운영 중인 시스템의 아키텍처를 공개하며 멀티 에이전트 시스템 개발자들에게 실용적인 가이드를 제공합니다.
AI 에이전트의 메모리 관리 방식에 대한 비판적 분석으로, 매 턴마다 MEMORY.md 파일을 업데이트하는 방식의 문제점을 지적합니다. 진정한 기억과 단순한 정보 축적의 차이를 설명하며, 더 효율적인 AI 메모리 아키텍처에 대한 대안을 제시하고 있어 AI 시스템 설계자들의 주목을 받고 있습니다.
AI 에이전트가 사회와 기업 운영에 미칠 장기적 영향을 포괄적으로 분석한 긴 글입니다. 자동화 확산, 일자리 변화, 의사결정 구조의 변화 등을 14분 분량으로 깊이 있게 다루며, AI 에이전트 시대에 대비해야 할 전략적 고려사항들을 제시합니다.
구글의 새로운 TorchAX 라이브러리를 사용해 TPU에서 허깅페이스 모델을 파인튜닝하는 상세한 튜토리얼입니다. Gemma 모델을 예시로 TPU의 성능을 최대한 활용하는 방법을 설명하며, GPU 대비 TPU의 비용 효율성과 성능상 이점을 실무적으로 검증하는 내용으로 머신러닝 엔지니어들의 관심을 끌고 있습니다.
현대 이메일 시스템의 복잡성을 기술적 관점에서 분석한 글로, 26개의 댓글이 달리며 활발한 토론이 진행되고 있습니다. SMTP, 보안, 네트워킹의 복잡함을 통해 우리가 당연하게 여기는 기술의 이면을 탐구하며, 개발자들이 간과하기 쉬운 인프라의 복잡성에 대한 인식을 높이고 있습니다.
실제 엔지니어를 위한 스킬 모음집으로, Claude AI와의 협업을 통해 개발된 실무 중심의 개발 스킬 가이드입니다. .claude 디렉토리에서 가져온 실전 경험을 바탕으로 한 스킬셋을 제공하며, AI 기반 개발 워크플로우의 좋은 예시가 되고 있습니다.
+5,645
브라우저에서 완전히 실행되는 제로-서버 코드 인텔리전스 엔진으로, GitHub 저장소나 ZIP 파일을 드래그앤드롭하면 대화형 지식 그래프를 생성합니다. 내장된 Graph RAG 에이전트로 코드 탐색과 이해를 혁신적으로 개선하며, 개발자들이 대규모 코드베이스를 빠르게 파악할 수 있게 도와줍니다.
+1,102
마이크로소프트가 오픈소스로 공개한 최첨단 음성 AI 시스템으로, 자연스러운 음성 합성과 인식 기능을 제공합니다. 기존 상용 음성 AI들과 경쟁할 수 있는 품질을 오픈소스로 제공하여, 음성 AI 개발자들이 자유롭게 활용하고 개선할 수 있는 기반을 마련했습니다.
+757
코딩 AI 에이전트를 위한 메모리 업그레이드 시스템으로, AI가 과거 작업과 학습 내용을 기억하고 활용할 수 있게 해줍니다. 단순한 컨텍스트 윈도우를 넘어서 진정한 장기 기억을 구현하여, AI 코딩 어시스턴트의 성능을 획기적으로 향상시킵니다.
+498
다중 LLM 에이전트를 활용한 금융 트레이딩 프레임워크로, 여러 AI 에이전트가 협력하여 시장 분석과 거래 결정을 수행합니다. 리스크 관리, 포트폴리오 최적화, 시장 예측을 자동화하여 AI 기반 자동매매 시스템을 구축할 수 있습니다.
+248
DeepSeek을 범용 API로 변환하는 경량 고성능 미들웨어로, 다중 계정 로테이션과 Google, Claude, OpenAI API 호환성을 지원합니다. Docker와 Vercel Serverless 배포를 지원하여 DeepSeek 모델을 기존 AI 워크플로우에 손쉽게 통합할 수 있습니다.
+138
DeepSeek의 최신 대형 언어 모델 V3으로, 이전 버전 대비 추론 능력과 코드 생성 성능이 크게 향상되었습니다. 오픈소스로 공개되어 연구자들과 개발자들이 최첨단 AI 모델을 자유롭게 활용하고 개선할 수 있으며, 글로벌 LLM 경쟁에 새로운 변수가 되고 있습니다.
+81
nvtop보다 정확한 오픈소스 GPU 모니터링 도구로, 실시간 GPU 사용률, 메모리, 온도 등을 정밀하게 추적합니다. AI 모델 훈련이나 추론 작업 시 GPU 리소스를 효율적으로 관리하고 최적화할 수 있도록 도와주며, 머신러닝 엔지니어들의 필수 도구가 되고 있습니다.
+100
TerminalBench에서 1위를 기록한 오픈소스 AI 에이전트로, 터미널 명령어 실행과 시스템 관리 작업을 자동화합니다. 자연어로 복잡한 시스템 운영 작업을 지시하면 적절한 명령어를 생성하고 실행하여, DevOps와 시스템 관리 업무를 획기적으로 간소화합니다.
+343
구글이 Chrome 브라우저에 도입하는 네이티브 Prompt API로, 웹 개발자들이 외부 AI 서비스 없이도 브라우저에서 직접 AI 기능을 구현할 수 있습니다. 웹 애플리케이션에 AI를 통합하는 과정을 혁신적으로 간소화하며, 프라이버시와 성능 면에서도 장점을 제공합니다.
+262
Michael Cooper, Samuel Cooper
언어 모델이 진정한 수학적 추론을 하는지, 아니면 단순한 패턴 매칭을 하는지를 소통 과정을 통해 평가하는 새로운 벤치마크를 제시합니다. 두 모델이 협력하여 수학 문제를 해결하는 과정에서 실제 이해도를 측정하며, LLM의 수학 능력 평가에 새로운 기준을 제시합니다.
Lisheng Zhang, Lilong Wang, Xiangyu Sun
의약품 발견 과정의 복잡한 워크플로우를 자동화하는 계층적 스킬을 가진 AI 에이전트를 소개합니다. 수십 개의 전문 도구를 조율하여 분자 스크리닝과 최적화를 수행하며, 기존 AI 에이전트들이 실패하는 다단계 작업에서도 안정적인 성능을 유지하여 신약 개발 속도를 혁신적으로 개선할 수 있습니다.
Benjamin Kohler, David Zollikofer, Johanna Einsiedler
AI 에이전트가 논문의 방법론 설명과 원본 데이터만으로 사회과학 실험 결과를 재현할 수 있는지 연구했습니다. 기존 코드 없이도 연구를 복제할 수 있다면 과학 연구의 재현성 위기 해결과 연구 검증 과정의 자동화에 큰 진전을 가져올 것입니다.
Dionizije Fa, Marko Culjak
LLM 기반 과학 에이전트가 데이터 분석을 자동화하면서 발견 가속화의 이면에 숨은 확증 편향 위험을 경고합니다. 진정한 과학적 진보를 위해서는 가설을 반박하려는 적대적 실험 설계가 필요하며, AI 에이전트의 과학 연구 참여 시 편향 방지 메커니즘의 중요성을 강조합니다.
Seyed Moein Abtahi, Rasa Rahnema, Hetkumar Patel
기존 메모리 방식의 한계를 극복하는 타입 기반 의미 메모리 시스템을 제안합니다. 정보 이론적 검색 방법을 통해 장기간 운영되는 AI 에이전트의 메모리 병목 문제를 해결하며, 프로덕션 등급 에이전트 시스템 배포에 필수적인 아키텍처 개선을 제시합니다.
Tharindu Kumarage, Lisa Bauer, Yao Ma
대형 언어 모델의 추론 능력과 배포 범위가 확장되면서 나타나는 자기 목적 추구 행동의 위험성을 체계적으로 분류했습니다. 새로운 위험 평가 프레임워크를 통해 AI 시스템이 자신의 목표를 위해 전략적으로 행동할 때 발생할 수 있는 문제들을 사전에 식별하고 대응할 수 있는 방법을 제시합니다.
Aofan Liu, Jingxiang Meng
반복적 자기수정이 AI 에이전트 시스템에서 언제 도움이 되고 언제 해로운지를 사이버네틱 피드백 루프 관점에서 분석했습니다. 동일한 언어 모델이 제어기와 플랜트 역할을 동시에 수행할 때의 문제점을 지적하고, 검증 우선 접근법을 제안하여 자기수정의 효과를 최적화할 수 있는 방법을 제시합니다.
마이크로소프트와 OpenAI가 기존의 독점적 파트너십과 매출 공유 계약을 종료한다고 발표했다. 이번 계약 개정으로 OpenAI는 더 많은 파트너와 협력할 수 있게 되고, 마이크로소프트는 기존 투자 회수에 집중할 수 있게 된다. AI 업계의 경쟁 구도에 큰 변화를 가져올 것으로 전망된다.
OpenAI가 ChatGPT Enterprise와 OpenAI API에 대해 FedRAMP Moderate 수준 보안 인증을 획득했다고 발표했다. 이로써 미국 연방 정부 기관들이 OpenAI의 AI 서비스를 안전하게 도입할 수 있는 길이 열렸다. 정부 시장 진출을 위한 중요한 이정표가 될 것으로 보인다.
GitHub이 Copilot 구독 모델을 사용량 기반 과금제로 변경한다고 발표했다. 기존 월 정액제에서 실제 코드 생성량에 따른 과금 방식으로 전환하여, 사용자들이 더 합리적인 비용으로 AI 코딩 도구를 활용할 수 있게 된다. 경쟁이 치열해진 AI 코딩 도구 시장에서 차별화 전략으로 보인다.
구글 연구진이 악성 웹페이지들이 간접적 프롬프트 인젝션을 통해 기업용 AI 에이전트를 조작하고 있다고 경고했다. Common Crawl 데이터베이스에서 발견된 수십억 개의 웹페이지 중 상당수가 AI 에이전트의 동작을 의도적으로 변경하려는 숨겨진 명령을 포함하고 있다. AI 에이전트 보안의 새로운 위협으로 주목받고 있다.
구글이 Chrome 브라우저에 내장된 AI 기능에 접근할 수 있는 Prompt API를 개발자 프리뷰로 공개했다. 웹 개발자들이 별도의 서버나 API 키 없이도 브라우저 내에서 직접 AI 기능을 활용할 수 있게 된다. 웹 애플리케이션의 AI 통합을 크게 간소화할 것으로 기대된다.
중국 당국이 메타의 AI 스타트업 Manus 인수를 차단했다고 CNBC가 보도했다. 중국 정부는 핵심 AI 기술의 해외 유출을 막기 위한 규제를 강화하고 있으며, 이번 결정도 그 연장선으로 해석된다. 글로벌 AI 기업들의 중국 내 투자 및 인수 활동에 제약이 커지고 있다.
OpenAI가 Codex 오케스트레이션을 위한 오픈소스 사양인 Symphony를 공개했다. 이슈 트래커를 항상 작동하는 에이전트 시스템으로 전환하여 엔지니어링 생산성을 높이고 컨텍스트 전환을 줄이는 것이 목표다. AI 에이전트 워크플로우 표준화에 기여할 것으로 기대된다.
구글 딥마인드가 대한민국 정부와 AI 연구 파트너십을 공식 발표했다. 최첨단 AI 모델을 활용한 과학적 돌파구 창출을 가속화하는 것이 목표다. 한국의 AI 연구 역량 강화와 글로벌 AI 생태계에서의 위상 제고에 기여할 것으로 전망된다.
알리바바의 새로운 Qwen3.6-27B 모델이 14배 더 큰 397B MoE 모델을 모든 코딩 벤치마크에서 압도했다고 발표됐다. 단일 RTX 4090 GPU에서도 실행 가능한 크기로 개발되어 접근성이 크게 향상됐다. 효율적인 소규모 모델의 가능성을 다시 한 번 입증한 사례로 평가된다.
MIT Technology Review에 따르면 많은 기업들이 AI 도입의 가장 큰 장애물이 데이터 상태라는 것을 발견하고 있다. 소비자용 AI가 관심을 끌고 있지만, 기업들은 AI 활용을 위해 기존 데이터 스택을 근본적으로 재구축해야 한다는 현실에 직면해 있다.
AI 도구가 우리의 사고를 대체하기보다는 증강해야 한다는 관점을 제시한 블로그 포스트가 화제가 되고 있다. AI에 지나치게 의존하지 말고 비판적 사고력을 유지하면서 AI를 보조 도구로 활용해야 한다고 주장한다. 개발자들 사이에서 AI 도구 사용법에 대한 철학적 논의가 활발하게 이뤄지고 있다.
오픈소스 AI 에이전트 Dirac이 Gemini-3-flash-preview 모델에서 TerminalBench 벤치마크 1위를 기록했다고 개발자가 Show HN에 공유했다. 터미널 작업 자동화에 특화된 에이전트로, 복잡한 명령줄 워크플로우를 효과적으로 처리할 수 있다고 한다. 커뮤니티에서 실제 성능과 활용 사례에 대한 관심이 높다.
AI 토큰 사용 최적화에 대한 새로운 관점을 제시한 글이 주목받고 있다. 단순히 토큰 비용을 줄이는 것보다는 문제를 더 작은 단위로 분해해서 접근하는 것이 중요하다고 강조한다. AI 에이전트 설계와 프롬프트 엔지니어링에서 실용적인 접근법을 제안하여 개발자들의 공감을 얻고 있다.
HNSW(Hierarchical Navigable Small World) 알고리즘이 어떻게 대규모 벡터 검색의 확장성 문제를 해결했는지 설명한 기술 글이 화제다. 수십억 개의 벡터에서 초단위 검색을 가능하게 한 핵심 원리를 상세히 분석했다. AI/ML 개발자들이 벡터 DB 설계에 참고할 수 있는 유용한 인사이트를 제공한다.
구글의 TorchAX를 사용해 TPU에서 Gemma 같은 HuggingFace 모델을 파인튜닝하는 방법을 소개한 튜토리얼이 주목받고 있다. TPU의 강력한 성능을 활용해 대규모 모델 학습 비용을 크게 절감할 수 있는 실용적인 가이드다. GPU 대안으로 TPU를 고려하는 개발자들에게 유용한 정보를 제공한다.
AI 에이전트의 메모리 관리 방법에 대한 비판적 관점을 제시한 글이 토론을 불러일으키고 있다. 매 턴마다 메모리 파일을 업데이트하는 것은 진정한 메모리가 아니라 노이즈라고 주장하며, 더 효율적인 메모리 아키텍처의 필요성을 강조한다. AI 에이전트 개발자들 사이에서 메모리 설계 패러다임에 대한 논의가 활발하다.
인기 AI 코딩 도구인 Cursor의 비즈니스 모델에 대한 질문이 개발자 커뮤니티에서 화제가 되고 있다. 무료 사용량이 관대한 편인데 어떻게 수익성을 확보하는지에 대한 궁금증이다. AI 도구 시장의 경쟁이 치열해지면서 각 서비스의 지속가능성에 대한 관심이 높아지고 있다.
AI 데이터베이스 개발자가 프로덕션 환경에서 핵심적인 3가지 기능을 구현했다고 발표한 글이 주목받고 있다. 벡터 데이터베이스의 실제 운영에서 필요한 안정성, 확장성, 성능 최적화 경험을 공유한다. AI 애플리케이션 인프라 구축을 고민하는 개발자들에게 실용적인 인사이트를 제공한다.
Mercor에서 4만 명의 AI 계약자들의 4TB 분량 음성 샘플이 해킹으로 유출되는 보안 사고가 발생했다. AI 음성 합성 및 훈련용 데이터의 보안 취약성을 드러낸 심각한 사건으로 평가된다. AI 데이터 보안과 개인정보 보호에 대한 업계의 경각심을 높이는 계기가 되고 있다.
프로젝트를 시작하기 전에 반드시 고려해야 할 3가지 제약조건에 대한 개발자의 경험담이 공유되고 있다. 시간, 자원, 기술적 제약을 미리 파악하여 현실적인 프로젝트 계획을 세우는 방법론을 제시한다. AI 프로젝트처럼 불확실성이 높은 영역에서 특히 유용한 접근법으로 평가받고 있다.
실제 엔지니어를 위한 스킬 가이드로 Matt Pocock의 .claude 디렉토리에서 직접 가져온 AI 활용 노하우를 담고 있다. AI 도구를 효과적으로 활용하는 실용적인 팁과 프롬프트 엔지니어링 기법을 제공한다.
+5,551
GitHub 저장소나 ZIP 파일을 업로드하면 브라우저에서 바로 대화형 지식 그래프를 생성하는 제로서버 코드 인텔리전스 엔진이다. Graph RAG 에이전트가 내장되어 코드 탐색과 이해를 크게 향상시킨다.
+1,074
마이크로소프트가 공개한 오픈소스 최첨단 음성 AI 시스템으로, 자연스러운 음성 합성과 인식 기능을 제공한다. 다양한 언어와 억양을 지원하며 실시간 음성 처리에 최적화되어 있다.
+771
코딩 에이전트를 위한 메모리 업그레이드 도구로, AI 어시스턴트가 이전 대화와 코드 컨텍스트를 효과적으로 기억하고 활용할 수 있도록 돕는다. 장기간 프로젝트 작업에서 일관성을 유지하는 데 특히 유용하다.
+485
다중 에이전트 LLM 기반 금융 거래 프레임워크로, 여러 AI 에이전트가 협력하여 시장 분석과 거래 결정을 수행한다. 백테스팅, 리스크 관리, 포트폴리오 최적화 기능을 통합 제공한다.
+183
DeepSeek을 범용 API로 변환하는 경량 고성능 미들웨어로, 다중 계정 로테이션과 Google, Claude, OpenAI API 형식을 지원한다. Vercel 서버리스와 Docker 배포가 가능해 실제 프로덕션 환경에 쉽게 적용할 수 있다.
+144
DeepSeek의 최신 대규모 언어 모델로, 이전 버전 대비 성능이 크게 향상되었으며 다양한 태스크에서 경쟁력 있는 결과를 보여준다. 오픈소스로 공개되어 연구자와 개발자들이 자유롭게 활용할 수 있다.
+60
Michael Cooper, Samuel Cooper
언어 모델이 단순한 패턴 매칭이 아닌 진정한 수학적 추론 능력을 갖고 있는지 평가하기 위한 새로운 테스트 방법론을 제시한다. 두 AI 시스템 간의 협력적 문제 해결 과정을 통해 창발적 수학적 추론 능력을 측정한다.
Lianrui Zuo, Yihao Liu, Gaurav Rudravaram
실제 임상 환경에서 적응적이고 재현 가능한 의료 영상 처리를 위한 에이전트 프레임워크를 제안한다. 데이터셋 인식 워크플로우 구성과 실시간 환경 적응을 통해 의료 AI의 실용성을 크게 향상시킨다.
Lisheng Zhang, Lilong Wang, Xiangyu Sun
복잡한 약물 분자 스크리닝과 최적화 워크플로우를 자동화하는 계층적 스킬 기반 AI 에이전트를 소개한다. 수십 개의 전문 도구를 조율하여 신약 개발 과정의 효율성과 정확성을 크게 개선할 수 있다.
Aofan Liu, Jingxiang Meng
LLM의 반복적 자기교정이 언제 도움이 되고 언제 해가 되는지를 사이버네틱 피드백 루프 관점에서 분석한다. 마르코프 진단 방법론과 검증 우선 개입 전략을 제안하여 자기교정의 효과성을 예측하고 개선한다.
Tharindu Kumarage, Lisa Bauer, Yao Ma
대규모 언어 모델이 자신만의 목적을 위해 행동할 수 있는 창발적 전략적 추론 위험을 체계적으로 분류하고 평가하는 프레임워크를 제시한다. AI 안전성 연구에서 중요한 새로운 위험 범주를 정의하고 대응 방안을 모색한다.
Seyed Moein Abtahi, Rasa Rahnema, Hetkumar Patel
다중 세션 자율 에이전트를 위한 타입 기반 의미 메모리 아키텍처 Memanto를 제안한다. 정보 이론적 검색 방법론을 통해 메모리 병목현상을 해결하고 장기간 에이전트 운영에서 일관성을 유지한다.