📚 2026-09-30 AI 논문 핵심 요약

📊 순위 기반: 5개 | 🤖 GLM 추천: 5개 📄 전문 분석: 9개 | 📝 초록 분석: 1개


📑 목차

  1. 📊📄 Raven: The Harness of Harnesses for Composabl… ⬆️452 ❌
  2. 📊📄 In-Context Learning for Robots: Methods and A… ⬆️279 ❌
  3. 📊📄 MaLiang-Harness: A Programmable Path to Image… ⬆️239
  4. 📊📄 Scaling Properties of Same-Family On-Policy D… ⬆️209
  5. 📊📄 Omni-IO Skills: Harnessing Your Agent Omni-Na… ⬆️156
  6. 🤖📄 LEGO-Anything: Coding Agents for 3D Scene Rec… ⬆️101
  7. 🤖📄 LLMs are General Asynchronous Agents ⬆️62
  8. 🤖📄 SoL-Refiner: Speed-of-Light One-Step Refineme… ⬆️28 ❌
  9. 🤖📝 HybridCUA: Learning to Orchestrate GUI and CL… ⬆️27
  10. 🤖📄 TabFM: A Zero-Shot Foundation Model for Tabul… ⬆️12 ❌

1. Raven: The Harness of Harnesses for Composable Agentic Intelligence

arXiv: 2609.33439 | 기관: EverMind | ⬆️ 452 | ⭐ 4937 📊 순위선정 | 📄 HTML 태그: ai-paper ml

❌ 분석 실패: Post “https://api.z.ai/api/coding/paas/v4/chat/completions”: context deadline exceeded (Client.Timeout exceeded while awaiting headers)


2. In-Context Learning for Robots: Methods and Applications

arXiv: 2609.36012 | 기관: Knowin AI | ⬆️ 279 | ⭐ 9 📊 순위선정 | 📄 HTML 태그: ai-paper ml

❌ 분석 실패: Post “https://api.z.ai/api/coding/paas/v4/chat/completions”: context deadline exceeded (Client.Timeout exceeded while awaiting headers)


3. MaLiang-Harness: A Programmable Path to Image and Video Generation

arXiv: 2609.34309 | 기관: National University of Singapore | ⬆️ 239 | ⭐ 11 📊 순위선정 | 📄 HTML 태그: mllm text-to-image text-to-video code-generation visual-programming agentic-workflow benchmark controllable-generation 사전 지식: MLLM(Multimodal Large Language Model, 멀티모달 대형 언어 모델), 확산 모델(Diffusion Model)과 흐름 매칭(Flow Matching) 기반 생성, 시각 프로그래밍(Visual Programming, ViperGPT류 코드로 그림 그리기 접근), 렌더링 백엔드(Canvas, SVG, Three.js), LLM-as-a-Judge 평가 방식, 에이전트 루프(Agentic Loop, 생성-피드백-수정 반복 구조)

한 줄 요약

코드가 정상 실행돼도 원하는 그림이 안 나오는 P2V 간극(Program-to-Visual Gap)을 정의하고, 프로그램·생성 이력·검증을 하나의 버전 관리 체계처럼 묶은 MaLiang-Harness를 통해 이미지·영상 생성을 확률적 픽셀 합성이 아닌 프로그래밍 가능한 경로로 전환할 수 있음을 보인 연구다.

💡 핵심 아이디어

건축을 예로 들어보자. 설계도가 구조적으로 문법에 맞아도(프로그램 실행 성공) 지어진 집의 방 배치가 고객 요구와 다를 수 있다. MaLiang-Harness는 이때 필요한 공사 감리자 역할을 한다. 설계도(시각 프로그램), 시공 일지(생성 이력), 검사 보고서(검증 결과)를 모두 같은 개정(revision) 번호로 묶어 관리하기 때문에, 결과물이 이상하면 어떤 설계 변경이 원인인지 추적하고 정확히 그 지점부터 수정할 수 있다. 제목의 마량(Ma Liang)은 그림이 실제로 되는 신기한 붓을 가진 중국 민화 인물에서 따온 것으로, “코드라는 붓으로 그림을 그린다”는 패러다임을 상징한다.

문제 정의

시각 생성의 주류 패러다임은 확산(Diffusion)·흐름 매칭(Flow Matching) 모델 같은 직접 합성 방식이지만, 생성 과정이 암시적이라 제어가 어렵다. 이에 반해 MLLM(Multimodal Large Language Model)으로 실행 가능한 시각 프로그램을 만드는 접근이 떠오르고 있는데, 여기에 새로운 문제가 있다. 프로그램 수준의 정확성과 시각적 요구사항 충족 사이의 불일치, 즉 P2V 간극이다. 객체가 엉뚱한 위치에 있거나, 애니메이션 이벤트가 엉뚱한 시점에 발생하는 식이다. 이는 개발자에게 익숙한 “유닛 테스트는 통과하는데 요구사항은 틀린 코드” 문제의 시각 생성 버전이다.

🔬 방법론 상세

  • PEG (Persistent Executable Generation, 지속 가능한 실행 생성 상태): 프로그램과 태스크 컨텍스트를 수정 사이클 전반에 걸쳐 유지한다. 매번 프롬프트부터 처음부터 재생성하는 것이 아니라, 이전 상태를 이어받아 작업하는 지속적인 작업 공간처럼 동작한다.
  • TGP (Traceable Generation Process, 추적 가능한 생성 과정): 각 생성 연산을 상태 변화와 렌더링 결과에 연결한다. 어떤 편집이 어떤 시각 결과를 낳았는지 인과 관계가 기록되므로, 문제 발생 시 원인 회귀가 가능하다.
  • REV (Revision-aware Editing and Verification, 개정 인식 편집 및 검증): 과거 상태로부터의 수정을 지원하고, 현재 출력을 반드시 동일 개정에서 나온 증거로만 평가한다.
  • 통합 프로그래밍 시각 생성 인터페이스: Canvas, SVG, Scene2d, Three.js 등 서로 다른 렌더링 백엔드 위에서 상태 검사, 프로그램·에셋 편집, 렌더링, 요구사항 검증을 하나의 공유 프로토콜로 처리한다. MLLM은 프롬프트 p를 받아 계획을 세우고 실행 가능한 시각 프로그램을 생성하며, 렌더러가 이를 이미지나 영상으로 변환한다. 확산·흐름 매칭 과정 없이 코드 실행만으로 출력이 만들어진다는 점이 핵심 차별점이다.

핵심 기법

전체 프레임워크를 관통하는 원칙은 “공통 개정 참조점”이다. 소프트웨어 개발에 비유하면, PEG는 유지되는 작업 브랜치, TGP는 커밋과 빌드 산출물을 연결하는 git 로그, REV는 항상 현재 커밋의 CI 로그만 보고 코드 리뷰를 하는 것과 같다. 이전 버전의 스크린샷으로 새 코드를 평가하면 피드백 루프가 어긋나는데, 이를 구조적으로 차단한 것이 프레임워크의 가장 중요한 설계다. 성공 판정은 디코딩 가능한 출력이 하네스의 완료 검사를 통과하는 것으로 정의된다.

📊 정량적 결과

주요 성과

  • 평가 규모: 텍스트→이미지 벤치마크 MaLiang-IBench(50개 프롬프트)에서 DeepSeek·Kimi·GPT 계열 총 11개 모델, 텍스트→영상 벤치마크 MaLiang-VBench(13개 프롬프트)에서 4개 모델 평가
  • 품질 평가 설계: GPT-6-Sol을 심판(judge)으로 활용해 프롬프트 정합성, 미학, 구도를 5점 척도로 채점. 영상은 모션 일관성(motion coherence) 항목을 추가하고 영상당 시간 순서대로 12개 프레임을 사용
  • 비용 평가 설계: 생성 시간, 모델 호출 수, 토큰 사용량 추적. 누적 시간을 품질 기준 충족 이미지 수로 나눈 Time/Qualified, 성공 영상 수로 나눈 Time/Success 지표 사용. 실패 원인 중 토큰 예산 소진(Token Limit) 비율도 별도 집계

수치 해석 시 주의

제공된 전문 발췌에는 구체적인 백분율 개선 수치가 포함되어 있지 않다(결과 섹션이 중간에 잘려 있음). 다만 핵심 실험적 발견은 명확하다. 일반 능력 벤치마크 점수가 비슷한 모델이라도 시각 생성 결과는 크게 달랐으며, 이것이 시각 프로그램 생성 능력을 직접 평가해야 하는 근거가 된다. 또한 DeepSeek-V4-Pro는 시각 피드백 없이 평가되어 모델 간 비교 시 조건 차이가 존재한다.

🚀 기존 대비 개선점

  • 확산·흐름 매칭 모델의 암시적 생성 과정과 달리 생성 과정이 명시적 코드이므로, 객체 위치(공간)와 이벤트 시점(시간)에 대한 정밀한 제어가 가능하다.
  • 시각 피드백 기반의 반복적 정제(refinement) 루프를 통해 “실행은 되지만 요구와 다른” 결과물을 체계적으로 수정한다. 일회성 생성이 아닌 구축-검사-수정의 지속 프로세스다.
  • 특정 모델에 종속되지 않는 프레임워크 수준의 기여다. MLLM만 교체하면 되므로 모델 성능 향상을 그대로 활용하면서 평가도 표준화할 수 있다.

🎯 활용 분야

  • 정확한 구도와 레이아웃 제어가 필요한 그래픽 디자인, 일러스트, UI 목업 자동 생성
  • 이벤트 타이밍 제어가 중요한 스토리보드, 모션 그래픽, 애니메이션 사전 제작
  • 시각 이해·생성 능력을 갖춘 에이전트의 학습 및 평가 환경(harness 자체를 벤치마크 인프라로 활용), 코딩과 창작을 동시에 배우는 교육 도구

한계 및 주의사항

  • 포토리얼리즘(photorealism): 코드 기반 렌더링은 Canvas·Three.js류 기술에 의존하므로, 확산 모델이 만들어내는 사실적 질감·조명 표현에는 구조적 한계가 있다. 결론에서 저자도 이를 한계로 언급한다.
  • 비용과 안정성: 반복적인 모델 호출과 긴 코드 생성으로 인해 토큰 사용량이 크고, 토큰 예산 소진으로 인한 실패가 별도 범주로 존재한다. 성공률이 모델별로 크게 갈린다는 점도 실무 적용 시 고려사항이다.
  • 제공된 발췌 기준 결론이 중간에 잘려 있어(“Photorealism and stal…” 이후), 저자가 명시한 한계의 전체 목록은 확인할 수 없다.

4. Scaling Properties of Same-Family On-Policy Distillation

arXiv: 2609.32722 | 기관: Zhejiang University | ⬆️ 209 📊 순위선정 | 📄 HTML 태그: on-policy-distillation scaling-law knowledge-distillation reinforcement-learning weak-to-strong llm-reasoning kl-divergence grpo 사전 지식: 온폴리시 vs 오프폴리시 증류(On/Off-Policy Distillation), KL 발산과 k3 추정량(KL Divergence, k3 Estimator), LLM 강화학습과 GRPO(Group Relative Policy Optimization), 보상 최적화 초과(Reward Overoptimization), 거듭제곱 법칙 스케일링(Power-law Scaling)

한 줄 요약

이 논문은 온폴리시 증류(On-Policy Distillation, OPD)의 최종 성능이 학생·교사 모델 크기와 교사 점수의 거듭제곱 법칙(Power Law)으로 훈련 전에 예측 가능하며, 작은 교사가 큰 학생을 가르칠 때 학생이 교사 본인보다 뛰어나지는 현상을 25개 조합 실험으로 체계적으로 증명했다.

💡 핵심 아이디어

온폴리시 증류는 학생이 직접 푼 답안(롤아웃)을 교사에게 가져가면, 교사가 모범답안을 베끼게 하지 않고 토큰 단위로 “이 부분은 이렇게 고쳐보렴”이라고 교정해 주는 과외 방식이다. 이 논문은 이 과정에서 학생의 시험 점수가 “학생이 초기 상태에서 벗어난 거리(KL 발산의 제곱근)“에 대해 놀랍도록 일정한 직선 기울기로 오르는 규칙적 구간이 항상 나타남을 발견했다. 즉, 증류는 운이 아니라 재료(모델 크기, 교사 점수)를 보고 완성도를 계산할 수 있는 레시피가 되는 것이다.

문제 정의

RL로 완성된 추론 능력을 증류로 다른 모델에 옮길 때, 결과가 교사·학생 스케일에 따라 어떻게 달라지는지에 대한 법칙이 없어 매번 실제 훈련을 돌려봐야만 결과를 알 수 있었다. 이 논문의 핵심 질문은 “OPD를 수행하기 전에 교사와 학생의 스케일만으로 결과 학생 정책의 성능을 추정할 수 있는가?”이다. 이는 PPO에서 보상 최적화 초과(Reward Overoptimization)를 KL 발산의 함수로 기술한 Gao et al. (2023)의 분석 틀을 OPD로 확장하는 작업이다.

🔬 방법론 상세

  • 실험 설계: Qwen2.5 Base 5개 크기(0.5B, 1.5B, 3B, 7B, 14B)를 Dolci-SFT로 기본 지시 수행 능력을 깎은 뒤, GRPO로 GSM8K+MATH 혼합 학습셋 14.8K 문제에서 교사 5종을 만든다. 동일한 프롬프트로 weak-to-strong, same-base, strong-to-weak를 아우르는 총 25개 교사-학생 조합의 Vanilla-OPD를 최대 10 에포크(580 업데이트) 실행하며, verl 프레임워크로 구현했다.
  • 훈련 진척도의 정의: 토큰 수준 역방향 KL 발산(KL Divergence, 두 확률분포의 차이 척도)의 제곱근을 진행 변수 $d$로 사용한다. $$d = \sqrt{\mathrm{KL}(\pi_\theta | \pi_{\mathrm{ref}})}, \quad k_3 = \mathbb{E}{y\sim\pi\theta}\Big[\frac{1}{|y|}\sum_{t=1}^{|y|} e^{\delta_t} - \delta_t - 1\Big]$$ 여기서 $\delta_t = \log \pi_{\mathrm{ref}}(y_t|x, y_{<t}) - \log \pi_\theta(y_t|x, y_{<t})$이며, $k_3$ 추정량은 항상 양수이고 분산이 낮은 KL 추정기다.
  • 역학 특성화: 초기 30개 관측점에 선형 회귀 $G \approx G_0 + m \cdot d$를 적합하고, 실제 궤적이 이 직선의 95% 예측 밴드 아래로 3연속 체크포인트 동안 떨어지는 지점을 전이 종착점($d_{\mathrm{transfer}}$)으로 정의한다. 그 이후는 개선 둔화, 포화, 퇴보가 뒤섞인 노이즈 구간이 된다.
  • 스케일링 법칙 적합: 피크 골드 점수($G_{\mathrm{peak}}$)를 학생 크기, 교사 크기, 교사 골드 점수 세 변수의 결합 거듭제곱 법칙(Joint Power Law)으로 회귀해, Vanilla-OPD와 오프폴리시 변형(OffPD) 두 가지 모두에서 적합했다.

핵심 기법

대리 보상과 골드 보상의 구분이다. 교사가 제공하는 토큰별 보상은 대리 보상(Proxy Reward)이고, 홀드아웃 테스트셋 정확도는 골드 점수(Gold Score)다. 고무줄을 당길 때 당긴 길이에 비례해 장력이 선형으로 커지다가 한계를 넘으면 불안정해지듯, 학생의 실력도 초기 정책에서의 거리 $d$에 비례해 선형으로 오르다가 $d_{\mathrm{transfer}}$를 지나면 예측이 깨진다. 이 “직선 구간의 존재” 자체가 이 논문의 가장 중요한 발견이다.

📊 정량적 결과

주요 성과

  • 25개 Vanilla-OPD 실행 전체에서 예외 없이 초기 구간이 $d$에 대한 선형 상승(기울기 $m$)으로 나타났다. 즉 유용 전이 구간은 특정 조합이 아니라 보편적 규칙이다.
  • 관찰된 모든 weak-to-strong 쌍에서 학생의 피크 골드 점수가 교사 자체 점수를 초과했다. 예를 들어 0.5B 교사에게 배운 14B 학생이 교사보다 높은 정확도에 도달한다.
  • 학생의 피크 오차($1 - G_{\mathrm{peak}}$)가 교사의 잔여 오차($1 - G_{\mathrm{teacher}}$)에 거의 비례하며, 동일한 점수를 가진 교사라면 더 작은 교사가 더 잘 전이됐다.
  • 결합 거듭제곱 법칙이 두 OPD 변형 모두에서 $G_{\mathrm{peak}}$를 정확하게, 전이 기울기 $m$을 근사적으로 예측했다.

🚀 기존 대비 개선점

  • 부트스트래핑(작은 교사로 중간 모델을 만들고, 그 모델로 큰 모델을 가르치는 단계적 증류)이 가장 작은 전문가에서 직접 전이하는 것보다 이득이 없음을 밝혀, 불필요한 2단계 파이프라인을 제거할 수 있게 했다.
  • OffPD(교사의 답안을 직접 모방하는 오프폴리시 방식)가 OPD보다 열등함을 25개 조합 전반에서 정량적으로 입증했다.
  • 오프폴리시 콜드 스타트(교사 답안으로 SFT를 먼저 하는 방식)가 오히려 weak-to-strong 전이를 해친다는 반직관적 결과를 제시했다.

🎯 활용 분야

  • 훈련 전 의사결정: 교사·학생 조합의 예상 $G_{\mathrm{peak}}$를 사전에 계산해 OPD 실행 여부와 연산 예산을 결정, 시행착오 비용을 크게 절감할 수 있다.
  • 교사 선택 전략: 동일 점수라면 가장 작은 전문가 교사를 고르는 것이 최적이므로, 추론 시 교사 호출 비용을 줄일 수 있다.
  • 조기 중단 판단: $d_{\mathrm{transfer}}$ 이후 구간은 예측 불가능한 노이즈 구간이므로, 선형 구간의 예측값을 기준으로 검증 주기를 조절하고 낭비 업데이트를 줄일 수 있다.

한계 및 주의사항

  • 실험이 Qwen2.5 단일 계열과 수학 도메인(GSM8K+MATH)에 한정되어 있어, 다른 모델 계열이나 코드·에이전트 같은 도메인으로의 일반화는 이 논문만으로는 보장되지 않는다.
  • $d_{\mathrm{transfer}}$ 이후 구간은 개선 둔화, 포화, 퇴보가 뒤섞인 노이즈 구간이라 법칙적 예측이 불가능하며, 전이 기울기 $m$의 법칙 적합도도 $G_{\mathrm{peak}}$보다 근사적인 수준이다.

5. Omni-IO Skills: Harnessing Your Agent Omni-Native

arXiv: 2609.31847 | 기관: National University of Singapore | ⬆️ 156 | ⭐ 14 📊 순위선정 | 📄 HTML 태그: llm-agent multimodal omni-model mcp workflow-orchestration skills asset-registry plug-and-play 사전 지식: 멀티모달 모델(Multimodal Model)과 옴니 모델(Omni Model), AI 에이전트(Agent)와 장기 계획(Long-horizon Planning), MCP(Model Context Protocol)와 도구 호출(Tool Use), 방향성 비순환 그래프(DAG) 기반 워크플로 오케스트레이션, 컨텍스트 엔지니어링(Context Engineering)

한 줄 요약

이 논문은 파운데이션 모델을 재학습시키지 않고도 기존 에이전트가 텍스트, 이미지, 비디오, 오디오, 문서, 3D, 코드라는 7가지 모달리티(데이터 형태)를 자유롭게 입출력할 수 있게 만드는 플러그앤플레이형 시스템 계층(Agent Harness)을 제시함으로써, 멀티모달 능력 확장의 대가였던 ‘비싼 모델 업데이트’와 능력 성장을 분리시켰다는 점에서 중요하다.

💡 핵심 아이디어

이 논문의 해법은 “모델의 두뇌를 키우는 대신, 에이전트에게 잘 정리된 도구 세트를 쥐여준다”는 것이다. 마치 요리 솜씨는 그대로인 셰프(호스트 에이전트)에게 레시피 바인더(스킬), 주방기기용 표준 콘센트(MCP 도구 서비스), 재료와 완성품 보관 창고(Asset Registry, 자산 등록부)를 갖춰주면, 텍스트만 다루던 셰프가 조리 순서와 재료 의존 관계만 지키며 코스 요리 전체(멀티모달 워크플로)를 지휘할 수 있게 되는 원리다. 즉, 능력 확장이 ‘재학습’의 문제에서 ‘시스템 조립’의 문제로 바뀐다.

문제 정의

  • 실제 업무는 단일 모달리티에 머물지 않는다. 온라인 강좌 제작은 강의 녹화와 참고 문서로 시작해 콘텐츠 분석·시각 디자인을 거쳐 슬라이드, 일러스트, 내레이션, 설명 영상으로 끝나며, 이 산출물들은 사실·스타일·타이밍·제약을 서로 공유한다.
  • 딜레마 1 (오므라이스 모델 노선): 통합 자기회귀(autoregressive) 방식으로 모달리티를 늘리면, 표현 방식·학습 목표·충실도 요구를 맞추기 위해 새 데이터, 코덱, 디코더, 정렬(alignment) 단계가 계속 필요해 확장 비용이 눈덩이처럼 불어난다.
  • 딜레마 2 (전문 모델 조립 노선): 전문 모델과 미디어 엔진은 각자 빠르게 발전하지만, 이를 조립할 경우 작업 절차(procedures), 의존성(dependencies), 중간 산출물(intermediate assets), 대화 턴에 걸친 수정(cross-turn revisions)을 누가 어떻게 조율할지가 미해결 상태로 남는다.

🔬 방법론 상세

  • 계층적 스킬 체계 (Hierarchical Skills)

    • Atomic Skill(원자 스킬): 도구 1개에 대응하는 최소 단위 작업
    • Expert Skill(전문 스킬): 원자 스킬을 묶은 도메인 절차 (예: 오디오+문서를 결합한 회의 요약)
    • Scenario Skill(시나리오 스킬): 종단 간(end-to-end) 워크플로 템플릿
    • Skill Entry 계층이 사용자 요청을 보고 관련 스킬을 골라 실행 가능한 태스크 명세(executable task specification)로 확장한다. 즉, 절차 지식을 프롬프트가 아니라 재사용 가능한 구조로 저장한다.
  • 선언형 실행 그래프 (Declare Execution Graphs, DEG)

    • 여러 에셋이 얽힌 워크플로를 그래프로 표현하고, 노드 간 의존 관계만 선언한다.
    • 의존성이 없는 독립 연산은 병렬로 스케줄링하고, 의존 관계가 있는 작업은 선행 결과가 준비된 뒤에 실행되도록 순서를 자동 조율한다.
    • ‘어떻게(순서를 하드코딩)‘가 아니라 ‘무엇을(결과 간 의존)‘만 정의하므로, 중간에 요구가 바뀌어도 해당 노드만 다시 실행하는 부분 재수정이 가능하다.
  • 4계층 하네스 아키텍처와 영구 자산 등록부

    • Skill Entry 계층: 호스트 에이전트에 통합 태스크 인터페이스를 노출하고 스킬을 선택·확장
    • MCP Tool Service 계층: 이해(understanding), 생성(generation), 유틸리티 작업을 표준화된 인터페이스로 제공하고, 태스크 명세를 도구 능력에 매핑 (MCP는 Model Context Protocol, 모델과 도구를 잇는 표준 프로토콜)
    • Provider and Configuration 계층: 도구 능력을 실제 공급자(provider), 모델, 자격 증명, 기본 파라미터, 장애 시 대체 정책(fallback policy)에 연결. 덕분에 워크플로를 건드리지 않고도 백엔드 모델을 갈아끼울 수 있다.
    • Asset Registry 계층: 중간·최종 산출물을 정규화해 기록하고, 물리적 파일 경로와 독립적인 참조 ID를 부여한다. 이후 작업이 경로가 아닌 자산을 참조하므로 재사용과 이식성이 보장된다.
  • 모달리티 커버리지: 7가지 아티팩트 타입(Text, Image, Video, Audio, Document, 3D, Code)을 4개 운영 계열(크로스모달 이해, 생성, 추론, 검색)로 정리해, 이종 소스를 구조화된 증거(structured evidence)로 변환해 에이전트가 검증·재사용할 수 있게 한다.

핵심 기법

DEG(선언형 실행 그래프)는 레시피를 “1. 파를 볶는다, 2. 면을 삶는다, 3. …”처럼 순서대로 적는 대신, “소스는 볶은 파에 의존한다”처럼 의존 관계만 적어두는 방식이다. 그러면 주방 시스템이 파 볶기와 면 삶기를 알아서 동시에(병렬) 진행하고, 완성된 중간 결과물에는 번호표(자산 ID)를 붙여 창고에 넣는다. 나중에 “3번 소스만 다시”라고 말하면 그 노드만 재실행되고, 이를 쓰던 요리들만 자동으로 갱신된다. 긴 워크플로에서 발생하는 ‘순서 꼬임’과 ‘중간 파일 관리 지옥’을 동시에 해결하는 장치다.

📊 정량적 결과

주요 성과

  • UniM-90 벤치마크에서 GPT-5.6 Sol과 Claude Sonnet 5의 입력 지원률(input-support rate)을 기존 수준에서 100%까지 끌어올림 (하네스 없이는 처리하지 못하던 입력 유형까지 커버)
  • 상대 Semantic–Quality Coupled Score(의미-품질 결합 점수, 결과물이 요청 의도를 얼마나 유지하며 품질을 내는지 측정)가 각각 +47.95포인트, +49.96포인트 향상
  • Strict Structure Score(엄격 구조 점수, 지정된 산출물 구조를 얼마나 정확히 지켰는지 측정)에서 100.00(GPT-5.6 Sol)과 99.78(Claude Sonnet 5) 기록

🚀 기존 대비 개선점

  • 능력 확장의 주체가 모델 업데이트에서 시스템 조립으로 이동: 새 모달리티나 새 전문 모델이 나와도 재학습 없이 스킬·프로바이더만 추가하면 즉시 활용 가능
  • 전문 모델 수동 조립 방식의 미해결 문제(절차 조율, 의존성 관리, 중간 산출물 추적, 턴 간 수정)를 DEG + Asset Registry 조합으로 구조적으로 해결
  • 애플리케이션 워크플로가 특정 벤더나 워크스페이스 경로에 결합되지 않음: Provider 계층의 폴백 정책 덕분에 특정 모델 장애 시에도 대체 백엔드로 이어져 작업 지속성 확보

🎯 활용 분야

  • 온라인 교육 콘텐츠 제작 파이프라인: 강의 녹화·문서 → 콘텐츠 분석 → 슬라이드, 일러스트, 내레이션, 설명 영상까지 일관된 스타일로 일괄 생산
  • 멀티소스 리서치·회의 자동화: 오디오 녹취와 문서, 이미지, 영상, 3D 자료를 결합한 구조화된 요약·분석 보고서 생성
  • 제품 미디어 패키지 제작: 제품 사진과 기존 3D 모델을 입력으로 마케팅 영상, 문서, 코드(임베딩용) 등을 묶어서 산출
  • 호스트 에이전트(Codex, Claude Code 등 코딩 에이전트 계열)에 멀티모달 실행 능력을 부양하는 애드온 레이어

한계 및 주의사항

  • 하네스는 호스트 에이전트의 추론 코어를 바꾸지 않는다(plug-and-play의 전제이자 한계). 따라서 계획·추론 품질은 여전히 기반 LLM의 능력에 의존하며, 스킬이 아무리 정교해도 상위 에이전트의 판단 오류는 그대로 전이된다.
  • 결과물의 실질 품질 상한은 연결된 전문 프로바이더(외부 생성 모델)가 결정한다. 발췌된 본문에는 명시적인 한계 절이 제공되지 않았지만, 구조상 UniM-90 같은 벤치마크 성능이 실제 운영 환경의 비용·지연·프로바이더 장애 상황에서도 동일하게 유지될지는 별도 검증이 필요하다.

6. LEGO-Anything: Coding Agents for 3D Scene Reconstruction

arXiv: 2609.36380 | 기관: Amazon Web Services | ⬆️ 101 🤖 GLM추천 | 📄 HTML 태그: 3d-reconstruction coding-agent llm-agent image-to-code blender benchmark scene-generation embodied-ai 사전 지식: 3D 재구성의 출력 표현(메시, 포인트 클라우드, 포인트맵), 블렌더와 Python 스크립팅(bpy API), LLM 기반 코딩 에이전트와 도구 사용 루프(실행-관찰-수정 사이클), 시뮬레이터 기반 벤치마크와 합성 데이터의 장단점, 카메라 파라미터와 렌더링 파이프라인의 기초

한 줄 요약

단일 이미지로부터 3D 장면을 ‘한 번 찍으면 끝나는 고정 결과물’이 아니라 실행·편집·질의가 가능한 코드(장면 프로그램)로 재구성하는 Image-to-Code 패러다임을 제시하고, 코딩 에이전트의 코드 작성-실행-검증 반복 루프만으로 6개 모델 전부를 학습 없이 개선했음을 증명한 연구다.

💡 핵심 아이디어

레고 조립 설명서에 비유할 수 있다. 기존 3D 재구성은 완성된 레고 작품(메시나 포인트맵)을 통째로 건네주는 방식이라, 내부를 뜯어보거나 부분적으로 고치기 어렵다. 반면 이 논문은 사진 한 장을 보고 조립 설명서(블렌더 코드)를 직접 쓰게 만든다. 에이전트는 설명서대로 조립해보고(코드 실행), 완성물을 사진과 나란히 놓고 비교한 뒤, 틀린 부분만 설명서를 고쳐 다시 조립한다. 설명서(코드)가 남기 때문에 언제든 다시 실행하고, 객체 하나만 바꾸고, “이 장면에 의자가 몇 개 있지?” 같은 질문에도 답할 수 있다.

문제 정의

기존 접근은 두 진영으로 나뉜다. 모듈러 파이프라인(인지 → 재구성 → 에셋 검색 → 조립)은 전문 컴포넌트를 조합하지만, 최종 결과를 입력 이미지와 대조하며 되돌아 수정할 직접적인 수단이 없다. 학습 기반 모델(이미지를 3D로 직접 매핑)은 출력이 고정되어 있어 검사·편집·질의가 불가능하다. 즉, 재구성 결과가 사람이 다룰 수 있는 형태로 남지 않는 것이 핵심 문제다.

🔬 방법론 상세

  • Image-to-Code 정식화: 프로그램 P는 코딩 에이전트 π가 이미지 I와 3D 편집 환경 E(여기서는 블렌더)를 보고 생성하며(P = π(I; E)), 실행하면 장면 S가 된다(S = Exec(E, P)). 한 번에 다 짜지 않고, 중간 프로그램과 장면, 관찰 결과로 이루어진 궤적(Trajectory) τ = {(P_t, S_t, o_t)}를 쌓아가며 최종 P_T에 도달한다.
  • 시뮬레이터 기반 벤치마크(LEGO-Bench): 실사진은 정밀한 3D 정답이 없고 단순 합성 장면은 비현실적이라는 딜레마를, 전문가가 제작한 시뮬레이터 장면(LychSim)에서 렌더링한 입력으로 해결했다. 104개 장면에서 208개 이미지를 실내/실외 테마별로 구성했고, 난이도를 Easy ⊂ Medium ⊂ Hard 중첩 구조로 설계했다. 시뮬레이터 장면이 기반이므로 기하, 객체 정체성, 카메라 파라미터, 깊이, 인스턴스 마스크 같은 정답(Ground Truth)이 자동으로 따라온다.
  • 3축 분리 평가: 산출물 유효성(코드가 실행 가능한지), 가시 표면 기하(보이는 면의 형태가 맞는지), 렌더링 외관(사진과 닮았는지)을 각각 따로 점수화해, “그럴듯해 보이지만 형태가 틀린” 실패를 잡아낸다.
  • 궤적 분석 기반 플러그인(LEGO-Plugin): 에이전트의 작업 궤적을 분석해 세 가지 실패 모드(약한 초기화, 이전보다 나빠지는 퇴행적 수정, 신뢰할 수 없는 자기 평가)를 발견하고, 이를 향상된 초기화(Enhanced Initialization), 버전 관리(Version Control), 근거 기반 수정(Grounded Refinement)으로 막는다. 재학습이 전혀 필요 없다.

핵심 기법

가장 중요한 것은 실행 피드백 루프다. 조각가가 모델 사진을 옆에 두고 점토를 만진 뒤 계속 사진과 비교하는 과정과 같다. 에이전트는 코드를 실행해 렌더링을 만들고, 원본 이미지와 비교한 뒤 다음 수정을 결정한다. 여기에 버전 관리가 얹혀 나빠진 수정은 이전 버전으로 되돌리고, 근거 기반 수정은 카메라 파라미터나 깊이 같은 실측 정보를 힌트로 줘서 에이전트가 “느낌”이 아니라 “근거”로 고치게 한다. 학습 없이 프롬프트와 워크플로 설계만으로 성능을 끌어올린 점이 실용적이다.

📊 정량적 결과

주요 성과

  • 벤치마크 규모: 104개 다양한 장면(실내·실외)에서 수집한 208개 이미지, 테마별 Easy/Medium/Hard 중첩 세트로 확장 가능한 구조
  • LEGO-Plugin 적용 시 학습 없이(Training-free) 평가한 6개 코딩 에이전트 모델 전부에서 산출물 유효성, 가시 표면 기하, 렌더링 외관 세 축 모두 향상
  • 핵심 발견: 현재 에이전트들은 유효한 장면 산출물은 안정적으로 만들지만, 기하 정합성은 아직 뒤처진다는 것을 3축 분리 평가로 정량화

참고로 제공된 초록과 결론 발췌에는 모델별 세부 수치(개선 백분율)가 잘려 있다. 정확한 퍼센트 비교는 원문의 실험 표(Section 4~5)를 직접 확인하는 것이 좋다.

🚀 기존 대비 개선점

  • 출력 형태의 전환: 메시, 포인트맵 같은 고정 3D 출력에서 벗어나, 실행·검사·편집·질의가 가능한 명시적 장면 프로그램으로 결과물을 재정의
  • 평가 방식의 전환: 정답이 없는 실사진 평가에서 벗어나, 시뮬레이터 기반으로 정밀한 자동 평가를 무료로 얻으면서도 자연스러운 이미지 품질을 유지
  • 개선 방식의 전환: 모델을 다시 학습시키는 대신, 실패 궤적을 분석해 워크플로(초기화, 버전 관리, 근거 기반 수정)만 고쳐 6개 모델 공통으로 성능 향상

🎯 활용 분야

  • 게임·영화 씬 제작 자동화: 사진 한 장에서 블렌더에서 바로 수정 가능한 씬 초안을 생성해 아티스트 작업 시간을 단축
  • 로봇·임베디드 AI 학습 환경 구축: 재구성된 장면을 시뮬레이터에 넣어 합성 데이터 생성이나 도메인 랜덤화(학습 데이터의 다양성 확보 기법)에 활용
  • 3D 장면 이해 응용(LEGO-World): 완성된 장면 하나를 얼려둔 채 쿼리만으로 객체 검출, 분할, 깊이 읽기를 수행해 AR/VR 콘텐츠 제작이나 씬 그래프 구축에 사용

한계 및 주의사항

  • 기하 정합성 격차: 에이전트가 유효한 산출물은 안정적으로 만들지만, 보이는 표면의 형태를 정확히 복원하는 능력은 아직 부족하다. 겉모습만 그럴듯한 장면이 나올 수 있다.
  • 자기 평가의 신뢰성 문제: 에이전트가 스스로 렌더링 결과를 판단할 때 틀린 방향으로 판단하는 경우가 있어, 근거 기반 수정 같은 외부 보조장치가 필수적이다.
  • 다운스트림 성능 한계: LEGO-World로 검출·분할·깊이를 읽어낼 수는 있지만, 전용 모델의 성능 사양에는 크게 못 미친다는 점이 저자들도 인정한다.

7. LLMs are General Asynchronous Agents

arXiv: 2609.35427 | 기관: Yandex Research | ⬆️ 62 | ⭐ 9 🤖 GLM추천 | 📄 HTML 태그: llm ai-agents asynchronous-computing kv-cache asyncio real-time-systems training-free inference-engineering 사전 지식: KV Cache(어텐션 계산 재사용 구조), 어텐션 메커니즘과 하이브리드 아키텍처(소프트맥스 어텐션 + 순환 상태 레이어 혼합, 예: Gated DeltaNet, Mamba 계열), 코루틴과 asyncio(파이썬 비동기 프로그래밍, async/await, 이벤트 동기화), ReAct 패러다임(사고-행동-관찰 루프 기반 LLM 에이전트), 추론 서빙 시스템(vLLM류 엔진의 프리필/디코드 및 배치 처리 개념)

한 줄 요약

학습 없이 기존 LLM을 범용 비동기 에이전트로 바꿔주는 AsyncLLM 프레임워크를 제안하여, 음성 비서·로봇·모니터링처럼 ‘생각하는 도중에도 입력이 들어오는’ 실시간 환경에서 턴 기반 상호작용의 근본 한계를 하나의 통합 인터페이스로 해결했다는 점에서 중요하다.

💡 핵심 아이디어

기존 LLM 에이전트는 한 번에 한 가지만 처리하는 ‘한 손 요리사’와 같다. 냄비 하나를 젓는 동안(추론하는 동안) 다른 냄비가 타들어 가도(새 입력이 와도) 손을 뗄 수 없었다. AsyncLLM은 여러 개의 공유 화이트보드(메모리 블록)를 두고, 여러 코루틴이 동시에 이 화이트보드를 읽고 쓰며 작업한다. 한 코루틴이 깊은 생각을 적어 내려가는 동안 다른 코루틴이 새로 들어온 정보를 화이트보드에 끼워 넣으면, 생각하던 코루틴이 그 내용을 자연스럽게 참고해 반응한다. GPU는 여러 코루틴의 작업을 자동으로 하나의 배치로 묶어 주므로, 사용자는 동시성 제어가 아니라 애플리케이션 로직에만 집중하면 된다.

문제 정의

LLM 에이전트는 ReAct 스타일의 사고-행동-관찰(Thought-Action-Observation) 루프로, 즉 읽고 → 생각하고 → 답하거나 도구를 호출하고 → 반복하는 순차 구조에 최적화되어 있다. 그러나 실시간 음성 비서는 생각하면서 듣고 끼어들기를 처리해야 하고, 자율주행차는 판단 중에도 교통 상황 변화에 즉시 대응해야 하며, 모니터링 에이전트는 시스템 이상을 즉시 감지해야 한다. 현재 최신 기법은 이를 음성 전용 아키텍처, 비디오 스트림 처리, 로봇용 VLA(Vision-Language-Action, 시각·언어·행동 통합 모델), 비동기 도구 호출 등 태스크별로 따로 해결하고 있어, 동시성(concurrency)의 종류가 바뀔 때마다 새 시스템을 만들어야 하는 비효율이 있었다.

🔬 방법론 상세

  • AsyncLLM 추론 프레임워크: Python 표준 라이브러리인 asyncio의 async/await 모델 위에서 동작한다. 사용자(또는 에이전트 자신)가 겹치는 메모리 상태를 가진 추론 코루틴(Coroutine, 실행을 멈췄다 재개할 수 있는 함수)을 정의하면, 프레임워크가 이들을 자동으로 GPU 배치 실행으로 묶어 준다. 코드 예시를 보면 create_blocks로 메모리 블록을 만들고, generate 호출 시 cache_view(읽을 블록 목록)와 write_to(쓸 블록)를 지정하는 인터페이스가 핵심이다.
  • CacheBlocks: 조립 가능한(composable) 메모리 상태 단위. 토큰 일부(slice)에 대한 어텐션 KV 캐시(KV Cache, 이전 토큰의 계산 결과를 저장해 재사용하는 구조)와 Gated Delta Network(Yang et al., 2025)의 순환 상태(recurrent state, 이전 시점 정보를 압축해 담는 벡터)를 함께 담는다. 하이브리드 아키텍처(소프트맥스 어텐션 층과 순환 상태 층을 섞은 모델)의 두 종류 메모리를 동시에 관리할 수 있다는 점이 특징이다.
  • thinker-writer 동시 실행 패턴: 코드 예시에서 백그라운드 ‘생각가(thinker)’ 코루틴은 <think> 토큰으로 추론을 시작해 문단이 끝날 때마다(\n\n 토큰) asyncio.Event로 ‘요약가(writer)’ 코루틴에 신호를 보낸다. 요약가는 프롬프트 블록과 생각 블록, 자기 블록을 모두 cache_view로 읽어 요약을 생성한다. 즉, 생각이 완전히 끝나기 전에도 중간 결과를 실시간으로 소비할 수 있다.
  • 무훈련(training-free) 비동기화: 사전학습된 모델을 그대로 두고, 메모리 뷰 조작만으로 중간에 도착한 입력(텍스트 보완, 이미지 교체 등)을 컨텍스트에 반영한다.

핵심 기법

이 논문의 심장은 CacheBlocks 메모리 뷰 조작이다. 쉽게 말해 “생각의 흐름 도중에 메모리에 새 페이지를 끼워 넣는” 기술이다. 일반적인 추론 엔진은 프롬프트를 한 번에 넣고(프리필, Prefill) 출력을 순서대로 뽑는 게 전부였다. AsyncLLM은 여러 코루틴이 같은 KV 캐시와 순환 상태를 부분적으로 겹쳐 읽고(share view), 자기 구간에만 쓰도록 허용한다. 덕분에 ‘500스텝째 추론 중에 사용자가 보충 설명을 던져도’, 그 토큰들이 기존 생각 뒤에 자연스럽게 붙어 모델이 이후 추론부터 이를 반영한다. 별도 파인튜닝이나 전용 모델 없이 순수 엔지니어링으로 달성되는 지점이다.

📊 정량적 결과

주요 성과

  • MATH-500-Sharded: MATH-500(Hendrycks et al., 2021)의 500개 수학 문제를 ‘불완전한 프롬프트 + 보완 설명’ 두 조각으로 나누고, k번째 추론 스텝에 설명이 도착하도록 구성해 정확도를 측정했다(Figure 3 왼쪽). 하이브리드 어텐션 기반 Qwen 3.5+ 모델에서 평가했으며, 비하이브리드 버전의 AsyncReasoning(Yakushev et al., 2025)을 참조 baseline으로 함께 보고했다.
  • ShardedVQA: 이미지 질의응답 태스크에서 추론 도중 이미지가 바뀌는 상황의 정확도를 측정해, 텍스트가 아닌 입력(비주얼)에 대한 비동기 반응도 검증했다(Figure 3 오른쪽).
  • 4개 도메인 검증: 단일 비동기 입력 샌니체크를 넘어 실시간 스트리밍 비디오, 비디오게임 인터랙티브 에이전트, 텍스트 기반 시스템 모니터링까지 총 4개 도메인에서 학습 없이 비동기 동작이 성립함을 보였다.

수치 해석 시 주의

발췌문에는 정확한 정확도 백분율이 포함되어 있지 않다. Figure 3의 구조상 ‘비동기 입력이 도착한 스텝(k)에 따라 정확도가 어떻게 변하는가’가 핵심 평가 축이며, 원문의 그림에서 구체적 수치를 직접 확인하는 것을 권장한다. 실험 설계의 취지는 ‘입력이 늦게 와도, 이르게 와도 프레임워크가 견고하게 동작하는가’를 단계별로 고립시켜(isolate) 검증하는 것이다.

🚀 기존 대비 개선점

  • 태스크별 전용 아키텍처의 통합: 음성용 모델, 비디오 스트림 전용 처리, 로봇용 VLA, 비동기 API 호출 등 난립하던 해법을 하나의 범용 프레임워크로 일반화했다.
  • 무훈련 전환: 파인튜닝이나 강화학습 없이 기존 사전학습 LLM(특히 하이브리드 어텐션 모델)을 그대로 비동기 에이전트로 동작시킨다.
  • 시스템 복잡도의 추상화: 코루틴의 GPU 배치 실행을 프레임워크가 자동 처리하므로, 개발자는 vLLM 같은 서빙 엔진 내부가 아니라 asyncio 수준의 애플리케이션 로직만 작성하면 된다.

🎯 활용 분야

  • 실시간 음성 비서: 사용자 말을 듣는 동시에 답변을 준비하고, 끼어들기(interruption)를 자연스럽게 처리
  • 내재화 에이전트(embodied agent)와 게임 봇: 스트리밍 비디오나 게임 상태 변화에 즉각 반응하는 인터랙티브 플레이
  • 시스템/운영 모니터링 에이전트: 로그·이벤트 스트림을 상시 관찰하다가 이상 징후 발생 시 즉시 개입
  • 장시간 심층 추론 중 사용자 개입: 몇 시간 이어지는 코딩·리서치 에이전트 작업 도중 사용자가 힌트나 정정을 주입하는 워크플로

한계 및 주의사항

  • 하이브리드 아키텍처 의존성: KV 캐시와 Gated Delta Network 순환 상태를 함께 다루는 구조 특성상, 범용 소프트맥스 어텐션 전용 모델에서의 동일한 효과는 하이브리드가 아닌 AsyncReasoning 결과를 ‘참조’ 수준으로만 제시했다. 메모리 뷰 조작이 사전학습 분포와 어긋나는 구간(예: 아주 이른 스텝에 입력이 끼어드는 경우)에서의 일반화 성능은 그림을 통해 별도 확인이 필요하다.
  • 무훈련 접근의 근본 한계: 모델이 비동기적으로 입력이 끼어드는 상황을 학습한 적이 없으므로, 끼어든 입력의 길이·위치·빈도가 극단적일 때 성능 저하 가능성이 남아 있다. 향후 비동기 인터랙션에 맞춘 학습 데이터 구축이 자연스러운 후속 연구 방향이다.

한눈에 보는 기여

이 논문은 ‘비동기성’을 모델 아키텍처의 문제가 아니라 추론 시스템(inference system)의 문제로 재정의했다. 코루틴과 공유 메모리 블록이라는 검증된 시스템 프로그래밍 개념을 LLM 추론에 접목해, 동시성 종류마다 새 모델을 만들던 패러다임을 종식시켰다는 점에서 공학적 파급력이 크다.


8. SoL-Refiner: Speed-of-Light One-Step Refinement for High-Resolution Video

arXiv: 2609.37969 | ⬆️ 28 🤖 GLM추천 | 📄 HTML 태그: ai-paper ml

❌ 분석 실패: Post “https://api.z.ai/api/coding/paas/v4/chat/completions”: context deadline exceeded (Client.Timeout exceeded while awaiting headers)


9. HybridCUA: Learning to Orchestrate GUI and CLI for Computer-Use Agents

arXiv: 2609.38008 | ⬆️ 27 | ⭐ 12 🤖 GLM추천 | 📝 초록 태그: llm-agent computer-use-agent gui cli automation tool-use agentic-ai rpa 사전 지식: LLM(대규모 언어 모델), 컴퓨터 사용 에이전트(CUA) 개념, 멀티모달 모델(Vision-Language Model), 도구 호출(Tool Use / Function Calling), RPA(로봇 프로세스 자동화)

한 줄 요약

화면 클릭(GUI)에만 의존하던 기존 컴퓨터 사용 에이전트(Computer-Use Agent, CUA)의 한계를 넘어, 명령줄 인터페이스(Command Line Interface, CLI)를 상황에 맞게 섞어 쓰는 방법을 제시함으로써, AI의 디지털 작업 수행을 더 빠르고 정확하며 확장 가능하게 만들었다는 점에서 중요하다.

💡 핵심 아이디어

엑셀로 매출 정리를 하는 직원을 상상해보자. 신입은 메뉴를 하나하나 클릭하며 천천히 작업하지만(GUI 방식), 베테랑은 마우스 클릭이 꼭 필요한 순간에만 클릭하고, 파일 정리나 반복 작업은 단축키와 명령어로 순식간에 처리한다(CLI 방식). HybridCUA는 AI 에이전트가 이 베테랑처럼 행동하도록 만든 것이다. 즉, 화면을 눈으로 확인해야 하는 작업은 그래픽 사용자 인터페이스(GUI)로 처리하고, 정해진 규칙으로 수행되는 작업은 명령어 한 줄로 끝내는 지능적인 작업 분배(Orchestration)를 학습한다.

핵심 통찰

사람에게 편한 인터페이스가 AI에게도 최적인 것은 아니다. GUI는 인간의 직관에는 맞지만, 에이전트 입장에서는 스크린샷 해석 실패, 잘못된 좌표 클릭 같은 불확실성이 크다. 반면 CLI는 텍스트 기반이라 결과를 명확하게 검증할 수 있어, 에이전트에게는 오히려 더 신뢰할 수 있는 작업 수단이다.

🚀 기존 대비 개선점

  • 효율성: 파일 복사, 일괄 이름 변경 같은 반복 작업을 GUI로 여러 단계 클릭하던 것을 명령어 한 줄로 끝내 작업 시간과 비용(토큰)을 크게 줄임
  • 정확성: 화면 인식 실패나 클릭 좌표 오류 같은 GUI 고유의 실수를 줄여, 여러 단계가 이어지는 긴 작업에서도 실패율이 낮아짐
  • 확장성: 앱마다 전용 API나 도구를 일일이 개발해 연결하던 기존 방식과 달리, GUI와 CLI만 있으면 어떤 소프트웨어에도 적용할 수 있어 새로운 앱으로의 확장이 쉬움

🎯 활용 분야

  • 사무 자동화: 문서 정리, 보고서 취합, 대량 파일 관리 같은 반복 업무를 사람 개입 없이 처리하는 차세대 RPA(로봇 프로세스 자동화, Robotic Process Automation)
  • 소프트웨어 개발 보조: 코드 수정, 빌드, 테스트, 배포까지 개발 환경 전반을 에이전트가 스스로 수행하는 코딩 에이전트
  • IT 운영 자동화: 서버 점검, 로그 분석, 환경 설정처럼 터미널 명령과 화면 조작이 섞여 있는 시스템 관리 업무

10. TabFM: A Zero-Shot Foundation Model for Tabular Data

arXiv: 2609.37959 | 기관: Google | ⬆️ 12 | ⭐ 2697 🤖 GLM추천 | 📄 HTML 태그: ai-paper ml

❌ 분석 실패: Post “https://api.z.ai/api/coding/paas/v4/chat/completions”: context deadline exceeded (Client.Timeout exceeded while awaiting headers)


📅 생성일: 2026-09-30 | 🤖 GLM-4.7