<?xml version="1.0" encoding="utf-8"?>
<?xml-stylesheet type="text/xsl" href="/paper-daily/assets/feed.xsl"?>
<rss version="2.0"
  xmlns:atom="http://www.w3.org/2005/Atom"
  xmlns:content="http://purl.org/rss/1.0/modules/content/"
  xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>888每日論文雷達 -- Embodied AI</title>
    <description>由每日研究資料與 LLM 生成的繁體中文研究摘要。</description>
    <link>https://tbdavid2019.github.io/paper-daily/</link>
    <atom:link href="https://tbdavid2019.github.io/paper-daily/feed.xml" rel="self" type="application/rss+xml"/>
    <language>zh-Hant</language>
    <pubDate>Thu, 01 Oct 2026 17:36:24 +0800</pubDate>
    <lastBuildDate>Thu, 01 Oct 2026 17:36:24 +0800</lastBuildDate>
    <generator>Jekyll</generator>
    
    <item>
      <title>每日論文雷達｜2026-10-01</title>
      <link>https://tbdavid2019.github.io/paper-daily/posts/2026/10/01/daily-paper-scout/</link>
      <guid isPermaLink="true">https://tbdavid2019.github.io/paper-daily/posts/2026/10/01/daily-paper-scout/</guid>
      <pubDate>Thu, 01 Oct 2026 08:00:00 +0800</pubDate>
      
      <category>embodied_ai</category>
      
      <description>今日概況</description>
      <content:encoded><![CDATA[<h2 id="今日概況">今日概況</h2>

<ul>
  <li><strong>日期</strong>：2026-10-01</li>
  <li><strong>主題</strong>：具身智能（Embodied Intelligence）</li>
  <li><strong>收錄數量</strong>：本次爬取總數 878 篇，去重後 757 篇，新候選 574 篇，經過篩選與主題高度相關並納入本次報告共 30 篇。</li>
  <li><strong>資料統計</strong>：涵蓋 Hugging Face、arXiv (<code class="language-plaintext highlighter-rouge">cs.RO</code>、<code class="language-plaintext highlighter-rouge">cs.AI</code>、<code class="language-plaintext highlighter-rouge">cs.CV</code>) 以及關鍵字命中論文。</li>
</ul>

<h2 id="must-read">Must-Read</h2>

<ul>
  <li><strong><a href="https://arxiv.org/abs/2609.39601">GroundingPI: A Grounding Foundation Model towards Physical Intelligence with Visual Primitives</a></strong>
    <ul>
      <li><strong>作者</strong>：Qize Yu, Lianrui Fan, Boyu Chen, Jiaqi Liang, Xini Ding</li>
      <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.AI</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.CV</code></li>
      <li><strong>摘要證據與關聯</strong>：針對現今視覺語言動作（VLA）與世界動作模型（WAMs）在複雜或微小物件定位上容易失敗、無法滿足閉環控制速度的問題，作者提出 4B 大小的基礎定位模型 GroundingPI。該模型透過共享詞彙表將點與邊界框生成為量化座標，並結合多模態與空間預訓練、監督微調及強化學習。對研究 VLA 模型與空間智能的研究者而言，這提供了提升實體環境物體辨識與定位精確度的重要基礎架構。</li>
    </ul>
  </li>
  <li><strong><a href="https://arxiv.org/abs/2609.39685">RoboCoach: World Models as Active Coaches for Compositional Robot Skills</a></strong>
    <ul>
      <li><strong>作者</strong>：Jiajun Liu, Yifan Chen, Yichao Liu, Jiayi Zhang, Ruoqu Chen</li>
      <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">huggingface</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.AI</code></li>
      <li><strong>摘要證據與關聯</strong>：長序列機器人操作（long-horizon manipulation）重組技能成本高昂。本文提出 ROBOCOACH，一個由世界模型引導的教練框架，利用想像中的失敗來指導示範請求與專家更新。其 RIDI（Route-Imagine-Diagnose-Improve）迴圈在共享動作條件世界模型 COACHWORLD 中執行可重用的技能專家，並透過進度判定器記錄。此研究對於探索世界模型與主動自我改進機制的具身智能研究者深具參考價值。</li>
    </ul>
  </li>
  <li><strong><a href="https://arxiv.org/abs/2609.39403">IronMind: Scaling Humanoid Dexterous Manipulation via Camera-Space Ego-Centric Pretraining</a></strong>
    <ul>
      <li><strong>作者</strong>：Huimin Pan, Yufan Ren, Kunpeng Song, Siyang Wang, Xiwen Zhang</li>
      <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code></li>
      <li><strong>摘要證據與關聯</strong>：人形機器人靈巧操作常面臨人類與機器人肢體結構差異的「具身鴻溝（embodiment gap）」及低成本第一人稱（egocentric）錄影缺乏軀幹運動學的挑戰。IronMind 透過相機空間的第一人稱預訓練，結合人類與異質機器人資料，預訓練人形靈巧操作策略。這對研究人形靈巧操作與利用大規模人類影片資料的學者提供了直接的解法。</li>
    </ul>
  </li>
</ul>

<h2 id="highly-relevant">Highly Relevant</h2>

<ul>
  <li><strong><a href="https://arxiv.org/abs/2609.39178">Exploiting Vulnerabilities: Universal Adversarial Attacks on Vision-Language-Action Models in Robotics</a></strong>
    <ul>
      <li><strong>作者</strong>：Songhua Yang, Ziyu Liu, Yuanwei Liu, Xuetao Li, Xuanye Fei</li>
      <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.CV</code>, <code class="language-plaintext highlighter-rouge">arxiv_keyword</code></li>
      <li><strong>摘要證據與關聯</strong>：探討 VLA 模型在機器人操作中的安全性，提出通用對抗物件（Universal Adversarial Object，一種具有優化表面紋理的球體），放置於機器人視野內即會顯著降低任務成功率。對於重視 VLA 模型強健性與安全防禦的研究者是重要的實證警訊。</li>
    </ul>
  </li>
  <li><strong><a href="https://arxiv.org/abs/2609.38537">Systematically Exploring the Capabilities of GPT-6 Astra as Embodied Policies</a></strong>
    <ul>
      <li><strong>作者</strong>：Galbot Team, Xuchuan Chen, Xiaoqian Cheng, Yu Deng, Lihe Ding</li>
      <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">huggingface</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code></li>
      <li><strong>摘要證據與關聯</strong>：評估 GPT-6 Astra 作為通用具身策略的能力，涵蓋直接控制、與學習策略合作及回饋自適應等六大領域。在夾爪與靈巧操作的混合控制實驗中展現特定成功率。對於探索通用基礎模型（Foundation Models）直接進行數值動作生成的具身研究者具參考價值。</li>
    </ul>
  </li>
  <li><strong><a href="https://arxiv.org/abs/2609.39514">Spike-driven Vision-Language-Action Model</a></strong>
    <ul>
      <li><strong>作者</strong>：Shuai Wang, Malu Zhang, Mingquan Liu, Weihui Dai, Dehao Zhang</li>
      <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_keyword</code></li>
      <li><strong>摘要證據與關聯</strong>：為解決傳統大型 Transformer 基底 VLA 模型在高資源限制平台上的延遲與能耗問題，提出首個支援機器人操作端到端直接訓練的脈衝驅動 VLA 框架（Spike-driven VLA）。這為具身智能在邊緣計算與能效優化方向開啟了新的可能。</li>
    </ul>
  </li>
  <li><strong><a href="https://arxiv.org/abs/2609.39820">Learning from Runtime Feedback through Failure-Bank Self-Evolution for Vision-Language-Action Models</a></strong>
    <ul>
      <li><strong>作者</strong>：Mingyue Cui, Zheyuan Liu, Yihan Zhu, Zheyuan Zhang, Meng Jiang</li>
      <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.AI</code>, <code class="language-plaintext highlighter-rouge">arxiv_keyword</code></li>
      <li><strong>摘要證據與關聯</strong>：針對 VLA 模型在複雜環境中常面臨策略與執行防護（safety shield）不匹配的問題，提出 FailBank 四階段自進化框架，將運行時的回饋轉換為持續的策略改進。</li>
    </ul>
  </li>
  <li><strong><a href="https://arxiv.org/abs/2609.39794">Inline Memory Meets Reusable Skills: Memory-centric Framework for Vision-Language-Action Model</a></strong>
    <ul>
      <li><strong>作者</strong>：Zaijing Li, Rui Shao, Bing Hu, Haoyu Zhang, Dongmei Jiang</li>
      <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.CV</code>, <code class="language-plaintext highlighter-rouge">arxiv_keyword</code></li>
      <li><strong>摘要證據與關聯</strong>：提出 Optimus-R 記憶導向 VLA 框架，透過插入可學習的記憶 Token 進行顯式查詢-技能記憶微調，藉此解決 VLA 模型適應新任務時的高成本與災難性遺忘問題。</li>
    </ul>
  </li>
</ul>

<h2 id="interesting">Interesting</h2>

<ul>
  <li><strong><a href="https://arxiv.org/abs/2609.38537">Memorize, Adapt, Ignore: Diagnosing Robot Learning Mechanisms under Training Data Variation</a></strong> (註：原文 ID 為 <code class="language-plaintext highlighter-rouge">2609.38401</code>)
    <ul>
      <li><strong>作者</strong>：Ke Zhang, Danica J. Sutherland, Chao Liu</li>
      <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code></li>
      <li><strong>摘要證據與關聯</strong>：透過系統性案例研究（如 ManiSkill 中的 RL 任務），探討在訓練資料變化（如物體尺寸、顏色、光照與語言提示的網域隨機化）下，機器人學習機制的底層運作模式。雖然關聯較為基礎科學性質，但有助於理解泛化機制的黑盒子。</li>
    </ul>
  </li>
  <li><strong><a href="https://arxiv.org/abs/2609.40325">WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents</a></strong>
    <ul>
      <li><strong>作者</strong>：Ziyan Jiang, Jingbo Yang, Jiabao Ji, Yujian Liu, Qiucheng Wu</li>
      <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">huggingface</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.AI</code>, <code class="language-plaintext highlighter-rouge">arxiv_keyword</code></li>
      <li><strong>摘要證據與關聯</strong>：針對互動式 3D 世界中的異常檢測（如漂浮物件、可穿行牆壁等），推出 WorldAuditBench 評估管道，考驗多模態代理在 3D 空間中的導航與異常檢索能力。</li>
    </ul>
  </li>
</ul>

<h2 id="idea-sparks">Idea Sparks</h2>

<ul>
  <li><strong>觀點一：從靜態感知到精確點箱量化（Grounding Foundations）</strong>
    <ul>
      <li>觀察：傳統 VLA 模型依賴通用視覺語言骨幹，在處理閉環控制中的微小或遮擋物件時表現不足。GroundingPI 透過將點與邊界框作為共享詞彙表的量化座標來改善定位。</li>
      <li>後續問題：這種將空間定位融入詞彙表的做法，能否無縫擴展到多機器人異質動作空間，並保持即時控制所需的低延遲？</li>
    </ul>
  </li>
  <li><strong>觀點二：透過世界模型與執行回饋實現自我進化（Self-Evolution &amp; World Models）</strong>
    <ul>
      <li>觀察：多篇論文（如 ROBOCOACH 與 FailBank）探討利用世界模型進行「想像中的失敗」模擬，或是將運行時防護回饋轉換為長效策略更新。</li>
      <li>後續問題：當世界模型的模擬環境與真實物理世界存在未建模的動態誤差（Sim-to-Real 鴻溝）時，基於想像失敗所做的策略更新是否會放大安全風險？</li>
    </ul>
  </li>
</ul>
]]></content:encoded>
    </item>
    
    <item>
      <title>每日論文雷達｜2026-08-28</title>
      <link>https://tbdavid2019.github.io/paper-daily/posts/2026/08/28/daily-paper-scout/</link>
      <guid isPermaLink="true">https://tbdavid2019.github.io/paper-daily/posts/2026/08/28/daily-paper-scout/</guid>
      <pubDate>Fri, 28 Aug 2026 08:00:00 +0800</pubDate>
      
      <category>embodied_ai</category>
      
      <description>今日概況</description>
      <content:encoded><![CDATA[<h2 id="今日概況">今日概況</h2>

<ul>
  <li><strong>日期</strong>：2026 年 8 月 28 日</li>
  <li><strong>主題</strong>：具身智能（Embodied Intelligence）</li>
  <li><strong>文獻統計</strong>：本期雷達共檢索 779 篇文獻（去重後 663 篇，時間窗口內候選 638 篇，新進候選 267 篇，關鍵字匹配 27 篇）。來源分佈包含 arXiv cs.RO (164)、arXiv cs.AI (250)、arXiv cs.CV (250)、arXiv keyword (15) 及 Hugging Face (100)。本期精選 10 篇代表性論文進行結構化分析。</li>
</ul>

<hr />

<h2 id="must-read">Must-Read</h2>

<h3 id="trapvla-trapping-vision-language-action-models-in-configured-failure-modes"><a href="https://arxiv.org/abs/2608.26578">TrapVLA: Trapping Vision-Language-Action Models in Configured Failure Modes</a></h3>
<ul>
  <li><strong>作者</strong>：Jun-Hui Liu, Kun-Yu Lin, Yi-Lin Wei, Xu-Han Chen, Yinghao Li</li>
  <li><strong>來源</strong>：arXiv (<code class="language-plaintext highlighter-rouge">cs.RO</code>, <code class="language-plaintext highlighter-rouge">cs.CV</code>, <code class="language-plaintext highlighter-rouge">arxiv_keyword</code>)</li>
  <li><strong>重點與研究關聯</strong>：本研究提出了針對視覺-語言-動作（Vision-Language-Action, VLA）模型的新型後門攻擊任務「配置失敗誘捕」（Configured Failure Trapping）。不同於以往將任意任務失敗皆視為攻擊成功的後門方法，該任務旨在透過隱蔽的文本觸發詞，精準誘導機器人產生特定配置的失敗模式（例如使機器人以指定的位置偏移進行抓取），大幅增加了隱蔽性與偵測難度；文中並提出用於合成訓練資料的資料引擎。對於具身智慧安全防禦與策略可靠性評估的研究者而言，此文揭示了精確動作控制下的新型安全漏洞。</li>
</ul>

<h3 id="predvla-a-sub-million-parameter-predictive-coding-policy-for-robot-manipulation"><a href="https://arxiv.org/abs/2608.26673">PredVLA: A Sub-Million-Parameter Predictive-Coding Policy for Robot Manipulation</a></h3>
<ul>
  <li><strong>作者</strong>：Hiroki Sawada, Shunichi Kasahara</li>
  <li><strong>來源</strong>：arXiv (<code class="language-plaintext highlighter-rouge">cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_keyword</code>)</li>
  <li><strong>重點與研究關聯</strong>：現行機器人操作基準多由大型預訓練 VLA 模型主導，此論文探討語言條件控制所需的最小模型規模。作者提出名為 PredVLA 的預測編碼策略，僅包含 68 萬（0.68M）個可訓練網路參數且無須機器人資料預訓練。其架構利用分層生成式遞迴動態來預測視覺特徵與本體感覺，且環境觀察僅透過特定機制影響潛在狀態。該工作為研究輕量化具身控制架構與邊緣端運算提供了具體實證。</li>
</ul>

<h3 id="clap-cross-embodiment-video-world-models-are-zero-shot-physical-simulators"><a href="https://arxiv.org/abs/2608.27406">CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators</a></h3>
<ul>
  <li><strong>作者</strong>：Kechen Liu, Ola Shorinwa</li>
  <li><strong>來源</strong>：arXiv (<code class="language-plaintext highlighter-rouge">cs.RO</code>, <code class="language-plaintext highlighter-rouge">cs.AI</code>, <code class="language-plaintext highlighter-rouge">cs.CV</code>)</li>
  <li><strong>重點與研究關聯</strong>：現有動作條件視訊模型多受限於單一機器人實體。本文提出跨實體動作條件視訊生成框架 CLAP，能夠在涵蓋人類與多種機器人代理的異質視訊資料上進行訓練。該方法基於時空動態遵循通用物理定律的假設，將跨實體視訊世界模型作為零樣本物理模擬器。這對致力於跨實體資料利用與基底世界模型構建的研究者具備高度參考價值。</li>
</ul>

<hr />

<h2 id="highly-relevant">Highly Relevant</h2>

<h3 id="pawbench-how-far-are-we-from-probabilistically-aligned-world-modeling"><a href="https://arxiv.org/abs/2608.27345">PAWBench: How Far Are We from Probabilistically Aligned World Modeling?</a></h3>
<ul>
  <li><strong>作者</strong>：Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević</li>
  <li><strong>來源</strong>：Hugging Face, arXiv (<code class="language-plaintext highlighter-rouge">cs.AI</code>, <code class="language-plaintext highlighter-rouge">cs.CV</code>)</li>
  <li><strong>重點摘要</strong>：針對視訊生成式世界模型提出基準測試 PAWBench。論文指出許多物理過程具有多種可能走向，世界模型除了生成單一合理軌跡外，更應在相同初始條件與動作下重現可能行為的分佈（即機率對齊，probabilistic alignment），並針對現有模型的分佈一致性進行評估。</li>
</ul>

<h3 id="riemann-10-an-embodied-world-action-model-for-physical-ai"><a href="https://arxiv.org/abs/2608.27033">Riemann-1.0: An Embodied World Action Model for Physical AI</a></h3>
<ul>
  <li><strong>作者</strong>：Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li</li>
  <li><strong>來源</strong>：arXiv (<code class="language-plaintext highlighter-rouge">cs.RO</code>)</li>
  <li><strong>重點摘要</strong>：提出名為 Riemann-1.0 的全因果自回歸世界動作模型（World Action Model），在單一因果序列中統一建模多視角視覺觀察、機器人狀態與實體動作，將機器人線上策略執行與動作條件世界模擬整合至單一</li>
</ul>

<h2 id="interesting">Interesting</h2>

<p>資料未提供</p>

<h2 id="idea-sparks">Idea Sparks</h2>

<p>資料未提供</p>
]]></content:encoded>
    </item>
    
    <item>
      <title>每日論文雷達｜2026-08-27</title>
      <link>https://tbdavid2019.github.io/paper-daily/posts/2026/08/27/daily-paper-scout/</link>
      <guid isPermaLink="true">https://tbdavid2019.github.io/paper-daily/posts/2026/08/27/daily-paper-scout/</guid>
      <pubDate>Thu, 27 Aug 2026 08:00:00 +0800</pubDate>
      
      <category>embodied_ai</category>
      
      <description>今日概況</description>
      <content:encoded><![CDATA[<h2 id="今日概況">今日概況</h2>

<ul>
  <li><strong>日期</strong>：2026 年 8 月 27 日</li>
  <li><strong>追蹤主題</strong>：具身智慧（Embodied Intelligence）</li>
  <li><strong>收錄數量與資料統計</strong>：
    <ul>
      <li>本週期共檢索 750 篇文獻（來源涵蓋 arXiv cs.AI 250 篇、arXiv cs.CV 250 篇、arXiv cs.RO 137 篇、Hugging Face 100 篇、arXiv 關鍵字搜尋 13 篇；Papers with Code 與 AlphaXiv 均為 0 篇）。</li>
      <li>經去重後為 647 篇，進入時間窗口候選共 612 篇（其中已過濾歷史文獻 322 篇，新候選文獻 290 篇），最終篩選出 30 篇關鍵字匹配論文，本日精選呈現 10 篇最具代表性研究。</li>
    </ul>
  </li>
</ul>

<hr />

<h2 id="must-read">Must-Read</h2>

<h3 id="streampi-streaming-multimodal-temporal-modeling-for-vision-language-action-models">StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models</h3>
<ul>
  <li><strong>作者</strong>：Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.26067</li>
  <li><strong>來源</strong>：arXiv (cs.CV, keyword), Hugging Face（Preprint）</li>
  <li><strong>摘要證據與重點</strong>：現有先進的視覺-語言-動作（VLA）模型（如 pi0.5）多採用單幀觀測架構，難以保留過往歷史觀測並建立精確的空間感知。本研究提出 StreamPI，這是一個流式多模態時間建模框架，核心設計為「指令錨定時間建模」（instruction-anchored temporal modeling），將每組（視覺觀測、語言指令）視為時間單元，在不引入任何額外模型參數的前提下為單幀 VLA 賦予時間推理能力。</li>
  <li><strong>對研究者的關聯</strong>：直接切中 VLA 策略在連續操作任務中的時間維度表徵缺失問題，其零額外參數的設計對計算資源受限的即時控制研究極具參考價值。</li>
</ul>

<h3 id="gaussvla-geometry-aware-spatial-reasoning-for-vision-language-action-model">GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model</h3>
<ul>
  <li><strong>作者</strong>：Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.24959</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.CV, keyword)（Preprint）</li>
  <li><strong>摘要證據與重點</strong>：現有 VLA 模型將視覺輸入扁平化為無固有幾何結構的 2D Patch Token，或僅加入缺乏表面法向與幾何信賴度的單目深度純量，限制了動作預測的結構化空間推理。論文提出基於 Mamba 架構的 GaussVLA，其核心包含高斯空間標記器（Gaussian Spatial Tokenizer, GST），將凍結的語義與深度特徵提升為緊湊的 3D Gaussian Token，並透過學習機制聚合具幾何顯著性的區域。</li>
  <li><strong>對研究者的關聯</strong>：為 VLA 引入 3D 高斯顯式幾何表徵與 Mamba 序列骨幹，有助於解決精細操作中 3D 空間關係理解不足的瓶頸。</li>
</ul>

<h3 id="tacforcing-streaming-action-generation-with-execution-time-tactile-feedback">TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback</h3>
<ul>
  <li><strong>作者</strong>：Jianbo Zhou, Boyuan Zhao, Yuzheng Zhang, Yiyang Chen, Wenxin Chen</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.25798</li>
  <li><strong>來源</strong>：arXiv (cs.RO, keyword)（Preprint）</li>
  <li><strong>摘要證據與重點</strong>：接觸密集型操作（contact-rich manipulation）需要在動作區間內因應動態變化的接觸狀態。現行基於動作區塊（Action Chunking）的 VLA 模型在執行前即預測完整軌跡，導致執行期間的觸覺反饋過期，而傳統高頻反應控制器又增加架構複雜度。TacForcing 提出流式動作生成框架，在單一架構中直接融合執行期的即時觸覺反饋。</li>
  <li><strong>對研究者的關聯</strong>：解決了 Chunking 式策略在接觸操作時的反饋延遲難題，有助於推進多模態觸覺整合與反應式閉環控制。</li>
</ul>

<hr />

<h2 id="highly-relevant">Highly Relevant</h2>

<h3 id="a-tendon-driven-five-fingered-hand-with-distributed-tactile-perception-for-dexterous-manipulation">A Tendon-Driven Five-Fingered Hand with Distributed Tactile Perception for Dexterous Manipulation</h3>
<ul>
  <li><strong>作者</strong>：Huayang Chen, Longhui Qin</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.25547</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.AI, keyword)（Preprint）</li>
  <li><strong>摘要證據與重點</strong>：針對人形機器人複雜操作中的靈巧度與觸覺感知瓶頸，設計了一款具備分散式觸覺感知的腱驅動五指靈巧手。結構上採用剛柔混合設計兼顧柔順性與操作力，並在五指的遠端與中間指節配置雙模態觸覺傳感單元以同步檢測接觸狀態（具體檢測細節論文摘要部分截斷，資料未提供）。</li>
  <li><strong>對研究者的關聯</strong>：提供具備高密度觸覺感知硬體載體的研究基礎，適合結合靈巧抓握與多模態感知策略學習。</li>
</ul>

<h3 id="ma-vla-multi-arm-vision-language-action-model-for-collaboration-and-compositional-generalization">MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization</h3>
<ul>
  <li><strong>作者</strong>：Zaibin Zhang, Junlan Xiao, Zhongbo Zhang, Yifan Wang, Li Kang</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.25864</li>
  <li><strong>來源</strong>：arXiv (cs.RO, keyword), Hugging Face（Preprint）</li>
  <li><strong>摘要證據與重點</strong>：多數 VLA 僅接收單一全域指令，缺乏針對多機械臂協作行為分配與組合的顯式機制。MA-VLA 提出統一框架，將多臂協作行為分解為中層原子提示（atomic prompts），並顯式進行各臂動作分配，以提升對未見過協作模式的組合泛化能力。</li>
  <li><strong>對研究者的關聯</strong>：切入雙臂與多臂具身控制的協同分配問題，為複雜長程協作任務提供了指令分解新思維。</li>
</ul>

<h3 id="v-link-recovering-lost-visual-representations-in-action-dit-for-vision-language-action-models">V-Link: Recovering Lost Visual Representations in Action DiT for Vision-Language-Action Models</h3>
<ul>
  <li><strong>作者</strong>：Yehao Lu, Jiarui Yang, Yuning Su, Yufeng Xie, Yu Zhong</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.25308</li>
  <li><strong>來源</strong>：arXiv (cs.CV, keyword)（Preprint）</li>
  <li><strong>摘要證據與重點</strong>：指出當前 VLA 架構中動作專家（Action Expert）難以充分存取 VLM 所提取的 3D 幾何與 2D 語義特徵，造成感知對齊減弱。V-Link 透過在視覺-語言轉換過程中顯式恢復丟失的視覺表徵，提升 Action DiT 在精細機器人操作上的控制表現。</li>
  <li><strong>對研究者的關聯</strong>：深入分析了 Diffusion Transformer 作為動作解碼器時的特徵傳遞瓶頸，對改進 VLA 內部特徵流動具啟發性。</li>
</ul>

<h3 id="zero-wam-in-context-world-action-modeling-from-human-videos-for-open-ended-task-generalization">Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization</h3>
<ul>
  <li><strong>作者</strong>：Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.26103</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.CV)（Preprint）</li>
  <li><strong>摘要證據與重點</strong>：借鑒大型語言模型的上下文學習（ICL）概念，將未見任務的操作指引以「人類示範影片」形式輸入，提出 Zero-WAM 世界-動作模型架構，透過影片作為任務規格描述，實現無需更新模型參數的零樣本跨任務操作泛化。</li>
  <li><strong>對研究者的關聯</strong>：將跨任務泛化轉化為影片提示的上下文學習問題，拓展了世界模型在機器人示範學習中的角色。</li>
</ul>

<h3 id="r3-training-robots-to-reason-in-natural-language-via-reinforcement-learning">$R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning</h3>
<ul>
  <li><strong>作者</strong>：Lehong Wu, Yuxiao Qu, Zheyuan Hu, Ivan Zhang, Limin Wei</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.26053</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.AI)（Preprint）</li>
  <li><strong>摘要證據與重點</strong>：探討 VLM 是否能直接透過自然語言推理來引導底層操作策略以應對長程任務。論文提出 $R^3$ 後訓練（post-training）框架，利用強化學習訓練機器人進行任務分解、約束追蹤、後果預測與錯誤恢復等顯式語言推理。</li>
  <li><strong>對研究者的關聯</strong>：驗證了語言空間推理與測試時計算（test-time compute）在提升具身策略容錯與規劃能力上的潛力。</li>
</ul>

<hr />

<h2 id="interesting">Interesting</h2>

<h3 id="code-world-model-coding-agent-as-world-brain">Code World Model: Coding Agent as World Brain</h3>
<ul>
  <li><strong>作者</strong>：Yiwen Chen, Guosheng Lin, Chi Zhang</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.25927</li>
  <li><strong>來源</strong>：arXiv (cs.AI, cs.CV), Hugging Face（Preprint）</li>
  <li><strong>摘要證據與重點</strong>：現有視訊世界模型多僅依賴視覺畫面學習狀態轉移，忽略物理演化背後的規則與因果機制。該研究提出將世界演化機制（透過語言模型的程式碼與推理能力）與視覺生成（視訊模型生成先驗）分離，藉由程式碼代理人維持長程因果一致性。</li>
  <li><strong>對研究者的關聯</strong>：雖然偏向通用世界模型與程式碼生成架構，但其「規則推理與視覺渲染分離」的概念對模擬環境構建與高階環境轉移預測有借鑒價值。</li>
</ul>

<h3 id="4dstreamctrl-interactive-video-generation-with-online-4d-control">4DStreamCtrl: Interactive Video Generation with Online 4D Control</h3>
<ul>
  <li><strong>作者</strong>：Shiqian Li, Chenguo Lin, Zhiguang Liu, Yu Tang, Jiarong Ou</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.25479</li>
  <li><strong>來源</strong>：arXiv (cs.AI, cs.CV)（Preprint）</li>
  <li><strong>摘要證據與重點</strong>：為了解決視訊生成模型無法同時具備 3D 一致視角控制、物件軌跡移動與即時流式生成的難題，提出具備即時 4D 線上控制能力的互動式生成框架（具體實作與指標資料未完整提供）。</li>
  <li><strong>對研究者的關聯</strong>：提供具備空間 4D 控制能力的視訊生成機制，對於構建可互動式具身模擬環境具潛在關聯。</li>
</ul>

<hr />

<h2 id="idea-sparks">Idea Sparks</h2>

<h3 id="觀察一即時流式streaming控制與即時多模態閉環反饋">觀察一：即時流式（Streaming）控制與即時多模態閉環反饋</h3>
<ul>
  <li><strong>洞察</strong>：StreamPI 與 TacForcing 均著眼於解決傳統 Chunking 或靜態單幀架構的時間落後問題。前者透過指令錨定在</li>
</ul>
]]></content:encoded>
    </item>
    
    <item>
      <title>每日論文雷達｜2026-08-26</title>
      <link>https://tbdavid2019.github.io/paper-daily/posts/2026/08/26/daily-paper-scout/</link>
      <guid isPermaLink="true">https://tbdavid2019.github.io/paper-daily/posts/2026/08/26/daily-paper-scout/</guid>
      <pubDate>Wed, 26 Aug 2026 08:00:00 +0800</pubDate>
      
      <category>embodied_ai</category>
      
      <description>今日概況</description>
      <content:encoded><![CDATA[<h2 id="今日概況">今日概況</h2>

<ul>
  <li><strong>日期</strong>：2026-08-26</li>
  <li><strong>主題</strong>：具身智慧（Embodied Intelligence）</li>
  <li><strong>收錄與篩選統計</strong>：
    <ul>
      <li>檢索來源總抓取量：710 篇（包含 arXiv cs.AI 250 篇、arXiv cs.CV 250 篇、arXiv cs.RO 102 篇、HuggingFace 100 篇、arXiv keyword 8 篇；Paperswithcode 0 篇、alphaxiv 0 篇）。</li>
      <li>去重後總數：631 篇。</li>
      <li>時間窗口（自 2026-08-22 起）候選篇數：564 篇。</li>
      <li>扣除已處理篇數（235 篇）後新候選：329 篇。</li>
      <li>關鍵字匹配並入選精選清單：28 篇（今日報告聚焦前 10 篇代表性研究）。</li>
    </ul>
  </li>
</ul>

<hr />

<h2 id="must-read">Must-Read</h2>

<blockquote>
  <p>依據系統設定評分門檻（Must-Read $\ge 80$），本日候選論文優先度分數最高為 50.0，故本日無達到 Must-Read 門檻之論文。</p>
</blockquote>

<hr />

<h2 id="highly-relevant">Highly Relevant</h2>

<h3 id="1-hierarchical-skill-retrieval-for-data-efficient-adaptation-of-vision-language-action-models">1. Hierarchical Skill Retrieval for Data-Efficient Adaptation of Vision-Language-Action Models</h3>
<ul>
  <li><strong>作者</strong>：Haoran Hao, Shahram Najam Syed, Jeff Schneider, Jeffrey Ichnowski</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.24042</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.AI</code>, <code class="language-plaintext highlighter-rouge">arxiv_keyword</code></li>
  <li><strong>重點與關聯</strong>：
大型機器人數據預訓練的 Vision-Language-Action (VLA) 模型在面對示範資料有限的新任務時容易出現效能退化。現有透過檢索（Retrieval）重用示範資料的方法多依賴視覺相似度、狀態-動作表示或任務級語言比對，容易忽略長程操作任務的階層結構（完整任務匹配少見，但可重用技能常見）。本研究提出階層式技能檢索機制，用以提升 VLA 模型在新任務適應上的資料效率。
<em>（註：具體評估數據與架構細節在輸入摘要中資料未提供）</em></li>
</ul>

<h3 id="2-ponderpounce-a-pretrained-mllm-as-an-episode-context-engine-for-robot-control">2. PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control</h3>
<ul>
  <li><strong>作者</strong>：Suhwan Choi, Jaeyoon Jung, Sungkyung Kim, Yunsung Lee, Youngjae Yu</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.24115</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.AI</code></li>
  <li><strong>重點與關聯</strong>：
多模態大型語言模型（MLLM）具備整合長視覺歷史與部分可觀測環境下推理的能力，但傳統 VLA 往往僅繼承其預訓練表示，未直接將其上下文能力視為 Episode 記憶。本研究提出 PonderPounce 架構，直接將 MLLM 原生的因果上下文（Causal Context）作為機器人記憶庫，由 System 2 MLLM（Ponder）在原生因果上下文中累積觀察、示範與先驗認知，以提供控制決策支援。
<em>（註：下游控制介面與實驗表現數據在輸入摘要中資料未提供）</em></li>
</ul>

<h3 id="3-do-robotic-world-models-really-follow-actions-diagnosing-and-aligning-action-conditioned-generation-for-policy-learning">3. Do Robotic World Models Really Follow Actions? Diagnosing and Aligning Action-Conditioned Generation for Policy Learning</h3>
<ul>
  <li><strong>作者</strong>：Sixiang Chen, Jiaming Liu, Jixian Wu, Yichen Guo, Tinghao Wang</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.24885</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.CV</code></li>
  <li><strong>重點與關聯</strong>：
動作條件世界模型常作為策略評估與改進的模擬器，但其核心假設——「生成的未來能忠實反映任意有效動作」——在非專家（off-expert）動作上缺乏驗證。論文提出診斷基準 WorldEcho，透過視覺完整性與 $\mathrm{SE}(3)$ 軌跡對齊來評估廣泛動作分佈下的動作遵循能力。診斷顯示現有世界模型在專家示範上表現合理，但在非專家動作跟隨上存在顯著缺口。
<em>（註：具體對齊演算法與量化指標在輸入摘要中資料未提供）</em></li>
</ul>

<h3 id="4-gripper-aware-vision-language-action-models">4. Gripper-aware Vision Language Action Models</h3>
<ul>
  <li><strong>作者</strong>：Hanyi Zhang, Zihong Luo, Tianyu Li, Khang Nguyen, Basu Hela</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.24603</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_keyword</code></li>
  <li><strong>重點與關聯</strong>：
現有 VLA 模型多數隱式假設「夾爪不變性（gripper invariance）」，且訓練資料以平行夾爪為主。然而抓取策略高度依賴具身硬體（如平行夾爪與吸盤在相同任務下需要完全不同的交互軌跡）。本研究針對此限制探討感知夾爪型態（Gripper-aware）的 VLA 模型構建，避免單一具身設定導致泛化能力受限。
<em>（註：模型設計與測試基準細節在輸入摘要中資料未提供）</em></li>
</ul>

<h3 id="5-syn2realtrack-bridging-the-gap-between-synthetic-and-real-world-datasets-for-online-multi-view-multi-target-tracking">5. Syn2RealTrack: Bridging the Gap Between Synthetic and Real-World Datasets for Online Multi-View Multi-Target Tracking</h3>
<ul>
  <li><strong>作者</strong>：Duong Nguyen-Ngoc Tran, Ngoc Doan-Minh Huynh, Cu Quoc Le, Hoang-Khang Nguyen, Long Hoang Pham</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.24130</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.AI</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.CV</code></li>
  <li><strong>重點與關聯</strong>：
在倉儲等場景的多視角 3D 感知中，合成至真實（Sim-to-Real）差距常破壞地面定位與跨相機 ID 關聯。本研究反對將該差異交由單一領域適應模組吸收的傳統做法，指出落差主要拆解於三個獨立點：相機校正、物體形狀先驗以及對物體總數已知的假設，並據此提出線上多視角多目標追蹤管線 Syn2RealTrack 進行分點修正。
<em>（註：追蹤精確度指標與實驗設置在輸入摘要中資料未提供）</em></li>
</ul>

<h3 id="6-resilience-matters-for-embodied-agents-system-new-metrics-systematic-evaluation-and-optimization">6. Resilience Matters for Embodied Agents System: New Metrics, Systematic Evaluation, and Optimization</h3>
<ul>
  <li><strong>作者</strong>：Yapeng Liu, Yuanzhao Zhai, Xudong Gong, Dawei Feng, Bo Ding</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.23839</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.AI</code></li>
  <li><strong>重點與關聯</strong>：
指出具身代理系統（EAS）過往依賴結果導向指標（如成功率、安全評分）會掩蓋執行過程中的動態行為，忽略了系統在擾動下恢復、穩定與自我擴展的「韌性（Resilience）」。文章針對 EAS 提出新的韌性指標、系統化評估方法與優化方向。
<em>（註：指標公式與具體優化演算法在輸入摘要中資料未提供）</em></li>
</ul>

<hr />

<h2 id="interesting">Interesting</h2>

<h3 id="1-fiber-optic-sensing-glove-for-high-performance-dexterous-manipulation-capture">1. Fiber Optic Sensing Glove for High Performance Dexterous Manipulation Capture</h3>
<ul>
  <li><strong>作者</strong>：J. D. Peiffer, Taylor Niehues, Li Guan, Ziyi Kou, Ergys Ristani</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.24572</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code></li>
  <li><strong>重點</strong>：
針對靈巧手操作捕捉中視覺易遮蔽、傳統感測手套易受磁場干擾與飄移的問題，開發採用多芯形狀感測光纖（Multi-core shape-sensing fibers）的感測手套，直接重建光纖的完整 3D 形狀而非僅測量曲率，並搭配註冊與逆運動學管線進行全手姿態追蹤。</li>
</ul>

<h3 id="2-caro-contact-agnostic-residual-observation-for-zero-shot-robust-quadruped-locomotion">2. CARO: Contact-Agnostic Residual Observation for Zero-Shot Robust Quadruped Locomotion</h3>
<ul>
  <li><strong>作者</strong>：Zihan Yang, Shixuan Han, Kexin Guo, Xiang Yu</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.24217</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code></li>
  <li><strong>重點</strong>：
針對四足機器人運動控制，提出在 RL 控制迴路中嵌入固定基座 Euler-Lagrange 模型以構建力矩級殘差觀測（Residual Observation）。該方法無需力矩感測器、顯式接觸估計或基於視覺的浮動基座位置與速度測量，藉由擾動觀測器提取動態不匹配訊號以達成線上適應。</li>
</ul>

<h3 id="3-tract-bridging-robot-control-and-visual-prediction-with-visual-tracks">3. TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks</h3>
<ul>
  <li><strong>作者</strong>：Zhi Cao, Howard Ji, Kevin Zhang, Kuangzhi Ge, Li Fei-Fei</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.24101</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code></li>
  <li><strong>重點</strong>：
指出機器人動作具備強烈的本體特異性且與圖像視覺變化對齊較弱，限制了世界模型的條件生成能力。論文提出以視覺軌跡（Visual Tracks）作為跨具身通用表示與中間介面，連結控制與未來視訊預測。</li>
</ul>

<h3 id="4-from-seeing-to-acting-smart-glasses-as-first-person-intelligence-platforms">4. From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms</h3>
<ul>
  <li><strong>作者</strong>：Jiangning Zhang, Haojun Chen, Yong Liu</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.24877</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.CV</code></li>
  <li><strong>重點</strong>：
針對智慧眼鏡從單純顯示配件轉變為第一人稱具身智慧平台的研究現況進行綜述，梳理結合穿戴者視覺、聽覺、動作與人機/物體互動的架構與挑戰（如功耗、散熱與隱私限制）。</li>
</ul>

<hr />

<h2 id="idea-sparks">Idea Sparks</h2>

<h3 id="觀察一世界模型中的控制訊號表示瓶頸與中介化趨勢">觀察一：世界模型中的「控制訊號表示」瓶頸與中介化趨勢</h3>
<p>世界模型在機器人領域面臨兩個極端難題：一方面如 <em>Chen et al.</em> 所指出的，傳統直接以機器人底層動作為條件的世界模型在非專家動作分佈上嚴重失效（無法忠實反映真實動態）；另一方面如 <em>TrAct</em> 所述，低階動作與像素變化的弱對齊阻礙了生成泛化。將控制訊號轉換為「具身無關的幾何/軌跡特徵（如 Visual Tracks）」或改進評估基準（如 WorldEcho），代表社群正嘗試重構世界模型的介面。</p>
<ul>
  <li><strong>後續問題</strong>：能否將 Visual Tracks 作為動作空間，構建一個雙層世界模型——上層預測物體與關鍵點的幾何流動，下層再結合具體硬體逆運動學，以緩解非專家動作下的幻覺問題？</li>
</ul>

<h3 id="觀察二具身先驗從黑盒泛化轉向本體解耦embodiment-disentanglement">觀察二：具身先驗從「黑盒泛化」轉向「本體解耦（Embodiment Disentanglement）」</h3>
<p>現有 VLA 模型常假設統一的觀察與動作映射，但近期研究開始反思這種過度抽象。<em>Gripper-aware VLA</em> 指出夾爪類型對操作邏輯的根本影響，<em>Syn2RealTrack</em> 將 Sim-to-Real 的落差精確拆解至感測幾何與先驗假設，而 <em>CARO</em> 則透過動力學模型殘差隔離接觸不確定性。</p>
<ul>
  <li><strong>後續問題</strong>：在多任務 VLA 預訓練中，顯式引入夾爪結構與接觸力學先驗（如透過條件 Prompt 或模組化頭部），是否比單純增加示範數據更能提升對異質末端執行器的零樣本遷移能力？</li>
</ul>
]]></content:encoded>
    </item>
    
    <item>
      <title>每日論文雷達｜2026-08-25</title>
      <link>https://tbdavid2019.github.io/paper-daily/posts/2026/08/25/daily-paper-scout/</link>
      <guid isPermaLink="true">https://tbdavid2019.github.io/paper-daily/posts/2026/08/25/daily-paper-scout/</guid>
      <pubDate>Tue, 25 Aug 2026 08:00:00 +0800</pubDate>
      
      <category>embodied_ai</category>
      
      <description>今日概況</description>
      <content:encoded><![CDATA[<h2 id="今日概況">今日概況</h2>

<ul>
  <li><strong>日期</strong>：2026 年 8 月 25 日</li>
  <li><strong>主題</strong>：具身智能（Embodied Intelligence）</li>
  <li><strong>收錄數量與資料統計</strong>：本次檢索共爬取 711 篇文獻（去重後 638 篇，時間窗口內候選 550 篇，扣除已處理 77 篇後為 473 篇新候選論文）。來源涵蓋 arXiv cs.AI (250)、cs.CV (250)、cs.RO (103)、Hugging Face (100) 及關鍵字檢索 (8)。經篩選後本日收錄 10 篇代表性論文進行分析。</li>
</ul>

<hr />

<h2 id="must-read">Must-Read</h2>

<p>本日無符合 Must-Read 門檻（評分 $\ge 80$）之論文。</p>

<hr />

<h2 id="highly-relevant">Highly Relevant</h2>

<h3 id="act-with-intent-distilling-behavior-intent-for-vision-language-action-models"><a href="https://arxiv.org/abs/2608.23478">Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models</a></h3>
<ul>
  <li><strong>作者</strong>：Sangoh Lee, Sangwoo Mo, Wook-Shin Han</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.AI, cs.CV, keyword)</li>
  <li><strong>重點與關聯</strong>：傳統 Vision-Language-Action (VLA) 模型的動作解碼器多依賴行為複製（Behavior Cloning, BC）進行訓練，這類方法僅監督給定情境下展示的運動指令，卻未顯式表達該行為所服務的局部語意目標；現有的未來監督信號（如未來畫面、軌跡）亦多側重於特定物理實現而非共享語意目標。本研究提出「意圖蒸餾」（Intention Distillation, I…，詳細名稱文摘未完整提供），旨在捕捉即將執行之行為的共享語意目標，為 VLA 政策提供更具目標導向的動作監督。</li>
</ul>

<hr />

<h2 id="interesting">Interesting</h2>

<h3 id="counteralign-counterfactual-supervision-for-vision-language-action-models"><a href="https://arxiv.org/abs/2608.21740">CounterAlign: Counterfactual Supervision for Vision-Language-Action Models</a></h3>
<ul>
  <li><strong>作者</strong>：Haru Kondoh, Kei Ota, Asako Kanezaki, Yueh-Hua Wu</li>
  <li><strong>來源</strong>：arXiv (cs.RO, keyword)</li>
  <li><strong>重點</strong>：針對行為複製僅提供正向示範、缺乏「哪些動作與指令不符」之負向監督的問題，本文提出 CounterAlign。該方法指出 VLA 的離線強化學習無需依賴人工策劃的非專家軌跡，可直接透過成功的專家示範建構反事實監督信號。</li>
</ul>

<h3 id="think-only-when-needed-prompt-authority-control-for-selective-slow-path-intervention-in-vision-language-action-manipulation"><a href="https://arxiv.org/abs/2608.23224">Think Only When Needed: Prompt-Authority Control for Selective Slow-Path Intervention in Vision-Language-Action Manipulation</a></h3>
<ul>
  <li><strong>作者</strong>：Zhiruo Zhou, Zelin Li, Xiwen Chen, Jiazhuo Li, Chenwei Wang</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.AI, cs.CV)</li>
  <li><strong>重點</strong>：研究發現在凍結的 VLA 策略中直接附加檢索文本會導致「提示形式崩潰」（prompt-form collapse），在 500 個狀態測試中使平均成功率從 92.47% 驟降至 3.00%。為此提出 TOWN-VLA，透過提示權限介面隔離文本干預，僅在必要時進行慢路徑介入。</li>
</ul>

<h3 id="pointing-vla-typed-spatial-grounding-interfaces-for-vision-language-action-manipulation"><a href="https://arxiv.org/abs/2608.23138">Pointing-VLA: Typed Spatial Grounding Interfaces for Vision-Language-Action Manipulation</a></h3>
<ul>
  <li><strong>作者</strong>：Xiwen Chen, Zelin Li, Zhiruo Zhou, Huiming Chen, Chenwei Wang</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.AI, cs.CV)</li>
  <li><strong>重點</strong>：針對 VLA 將空間座標序列化為文字或隱式 token 所造成的介面脆弱問題，基於 Embodied-R1 提出 Pointing-VLA。模型利用幾何專用輸出頭預測正規化點、物件功能定位（OFG）熱圖與視覺軌跡，並在 Bridge/WidowX 與實體取放任務中驗證了明確的執行合約設計。</li>
</ul>

<h3 id="unimem-unifying-multimodal-memory-and-control-for-vision-language-action-models"><a href="https://arxiv.org/abs/2608.22869">UniMem: Unifying Multimodal Memory and Control for Vision-Language-Action Models</a></h3>
<ul>
  <li><strong>作者</strong>：Lars Osterberg, Maggie Wang, Mac Schwager</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.CV, keyword)</li>
  <li><strong>重點</strong>：傳統 VLA 在處理非馬可夫（non-Markovian）任務時，常因外掛獨立 VLM 管理長期記憶而導致記憶瓶頸與訓練流程分裂。UniMem 提出統一架構，整合多模態記憶與控制機制，改善多歷史幀輸入可能引發的效能衰退問題。</li>
</ul>

<h3 id="robust-bimanual-vision-language-action-models-via-embarrassingly-simple-modality-masking"><a href="https://arxiv.org/abs/2608.22419">Robust Bimanual Vision-Language-Action Models via Embarrassingly Simple Modality Masking</a></h3>
<ul>
  <li><strong>作者</strong>：Dongzhou Cheng, Ziang Li, Yixiao Zhou, Haojuan Li, Jinghao Zhang</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.CV, keyword)</li>
  <li><strong>重點</strong>：針對基於 Query 的雙臂 VLA 在多視角與語言融合時因注意力分散而出現動作不連續與執行失敗的問題，提出僅需在訓練階段實施的模態遮罩機制（M3），在不更改模型架構與大規模預訓練的前提下提升雙臂操作的魯棒性。</li>
</ul>

<h3 id="inferring-action-from-future-latent-state-for-robotic-manipulation"><a href="https://arxiv.org/abs/2608.22067">Inferring Action from Future Latent State for Robotic Manipulation</a></h3>
<ul>
  <li><strong>作者</strong>：Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Jie Cheng</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.AI, cs.CV)</li>
  <li><strong>重點</strong>：質疑世界動作模型（WAMs）逐幀生成稠密未來影片的必要性，指出視覺過渡幀消耗過多計算與模型容量。該研究主張世界模型應專注於預測動作執行後的未來潛在狀態（latent state），並從中直接推斷機器人控制動作。</li>
</ul>

<h3 id="triplet2track-a-hierarchical-system-with-object-centric-representations-for-reliable-long-horizon-manipulation"><a href="https://arxiv.org/abs/2608.22800">Triplet2Track: A Hierarchical System with Object-Centric Representations for Reliable Long-Horizon Manipulation</a></h3>
<ul>
  <li><strong>作者</strong>：Jianxiang Liu, Gaojing Zhang, Chuan Wen, Qipeng Liu, Yuxuan Zhao</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.AI)</li>
  <li><strong>重點</strong>：針對端到端 VLA 資料黑箱與分層規劃缺乏在線反饋的缺陷，提出閉環長程模仿學習</li>
</ul>

<hr />

<h2 id="idea-sparks">Idea Sparks</h2>

<p>資料未提供</p>
]]></content:encoded>
    </item>
    
    <item>
      <title>每日論文雷達｜2026-08-24</title>
      <link>https://tbdavid2019.github.io/paper-daily/posts/2026/08/24/daily-paper-scout/</link>
      <guid isPermaLink="true">https://tbdavid2019.github.io/paper-daily/posts/2026/08/24/daily-paper-scout/</guid>
      <pubDate>Mon, 24 Aug 2026 08:00:00 +0800</pubDate>
      
      <category>embodied_ai</category>
      
      <description>今日概況</description>
      <content:encoded><![CDATA[<h2 id="今日概況">今日概況</h2>

<ul>
  <li><strong>日期</strong>：2026-08-24</li>
  <li><strong>主題</strong>：具身智慧（Embodied Intelligence）</li>
  <li><strong>收錄數量與資料統計</strong>：
    <ul>
      <li>爬取來源分佈：Hugging Face（100 篇）、arXiv cs.RO（65 篇）、arXiv cs.AI（250 篇）、arXiv cs.CV（173 篇）、arXiv 關鍵字檢索（5 篇）、Papers with Code（0 篇）、alphaXiv（0 篇）。</li>
      <li>總爬取量：593 篇，去重後：508 篇。</li>
      <li>時間窗口內候選：427 篇（已見：165 篇，新候選：262 篇）。</li>
      <li>本期選出 10 篇代表性論文進行分析。</li>
    </ul>
  </li>
</ul>

<hr />

<h2 id="must-read">Must-Read</h2>

<h3 id="just-noticeable-difference-modeling-for-token-compression-in-vision-language-action-models">Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models</h3>
<ul>
  <li><strong>作者</strong>：Zhuoyuan Li, Rui Zhao, Jin Wang, Hanwei Zhu, Cong Zhang</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.21247</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.CV, keyword)</li>
  <li><strong>重點與研究關聯</strong>：
在具身智慧代理中，Token 壓縮對於降低視覺-語言-動作（VLA）模型的推論成本與延遲至關重要。現有方案多透過視覺相似度、注意力權重或顯著性等間接冗餘指標引導修剪。本文提出基於最小可覺差（Just Noticeable Difference, JND）的建模方法來壓縮 Token。這項研究直接切入具身閉環控制對延遲高度敏感的需求，有助於優化機器人動作預測時的推論效率（具體壓縮率與性能指標於摘要中資料未提供）。</li>
</ul>

<h3 id="certvla-certified-defense-against-physical-visual-attacks-for-vision-language-action-models">CertVLA: Certified Defense against Physical Visual Attacks for Vision-Language-Action Models</h3>
<ul>
  <li><strong>作者</strong>：Hui Lu, Zhijie Peng, Yuqi Lin, Zaijia Yang, Jiaming He</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.20791</li>
  <li><strong>來源</strong>：arXiv (cs.AI, cs.CV, keyword)</li>
  <li><strong>重點與研究關聯</strong>：
VLA 策略易受到局部物理擾動的攻擊，而既有的可驗證防禦（Certified Defenses）主要針對離散標籤分類，無法直接驗證具連續性與時間相關性的動作。CertVLA 針對局部貼片（patch）與紋理攻擊提出可驗證的防禦機制，建構行為一致的動作校準區域，並利用確定性覆蓋遮罩（deterministic covering masks）確保至少存在一個不受攻擊影響的檢驗預測，為具身閉環控制的安全性提供了形式化防禦機制。</li>
</ul>

<h3 id="koala-gripper-co-designing-robotic-grippers-and-data-capture-devices-for-scaling-dexterous-manipulation-learning">Koala Gripper: Co-designing Robotic Grippers and Data-Capture Devices for Scaling Dexterous Manipulation Learning</h3>
<ul>
  <li><strong>作者</strong>：Amar Hajj-Ahmad, Zubin Kremer Guha, Tim Fofonoff, Zhi Ern Teoh, Ciarán T. O’Neill</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.20546</li>
  <li><strong>來源</strong>：arXiv (cs.RO, keyword)</li>
  <li><strong>重點與研究關聯</strong>：
為擴大靈巧操作學習的資料規模，手持式資料收集裝置的設計常受限於既有機器人夾爪形態，進而犧牲人體工學與操作效能。本文提出一種協同設計框架（Co-design framework），在設計流程中同時整合資料收集與機器人端執行的平台限制，並推出 Koala Gripper 系統，有助於解決具身操作資料收集與硬體部署之間的形態落差。</li>
</ul>

<hr />

<h2 id="highly-relevant">Highly Relevant</h2>

<h3 id="vt-muse-multimodal-unified-sequential-visuotactile-representation-learning-for-manipulation">VT-MUSE: Multimodal Unified Sequential Visuotactile Representation Learning for Manipulation</h3>
<ul>
  <li><strong>作者</strong>：Congsheng Xu, Qiaochu Yang, Fangyuan Shi, Yifan Han, Baijun Chen</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.21290</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.CV)</li>
  <li><strong>重點說明</strong>：傳統視觸覺操作常獨立編碼後融合，且多著眼於當前單步觀測，忽略了接觸過程的時間演化。VT-MUSE 提出兩階段統一序列表徵學習框架，第一階段透過跨模態時序對齊與遮蔽視角適應特定模態編碼器，以捕捉視觸覺交互中的細粒度時空依賴。</li>
</ul>

<h3 id="graph-operator-world-models-for-morphology-parameter-generalization-in-continuous-control">Graph-Operator World Models for Morphology-Parameter Generalization in Continuous Control</h3>
<ul>
  <li><strong>作者</strong>：Xu Yang, Yiqin Yang, Qianchuan Zhao</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.20936</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.AI)</li>
  <li><strong>重點說明</strong>：連續控制中的世界模型在面對連桿長度、質量、阻尼等形態參數變化時常出現性能退化。GraphOp-WM 提出一種結構化圖運算子世界模型，旨在讓學習到的狀態轉移模型能泛化至相關關節機器人族群中未見過的形態參數，提升世界模型在連續控制中的模組重用性。</li>
</ul>

<h3 id="a-collaborative-multi-modality-interaction-for-vla-based-end-to-end-autonomous-driving">A Collaborative Multi-Modality Interaction for VLA-based End-to-End Autonomous Driving</h3>
<ul>
  <li><strong>作者</strong>：Jingtao Sun, Xiaohai He, Yike Zhang, Dong Huang, Yaonan Wang</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.20890</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.CV)</li>
  <li><strong>重點說明</strong>：許多端到端自動駕駛 VLA 模型將決策簡化為視覺問答（VQA）任務，限制了解釋性與異質感測器的多模態互動。本文探討跨異質感測器的協同多模態互動機制，以提升長尾場景中的感知魯棒性與駕駛決策可靠度。</li>
</ul>

<h3 id="neural-primitive-an-efficient-end-to-end-local-planner-with-primitive-based-imitation-learning-for-autonomous-flight">Neural-Primitive: An Efficient End-to-end Local Planner with Primitive-based Imitation Learning for Autonomous Flight</h3>
<ul>
  <li><strong>作者</strong>：Zhitao Liu, Guangtong Xu, Zihan Wang, Jialiang Hou, Chao Xu</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.20948</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.AI)</li>
  <li><strong>重點說明</strong>：針對無人機在未知複雜環境中機載軌跡生成的計算-品質-記憶體三難問題，提出基於模仿學習的端到端局部規劃器。該系統利用輕量離線基元資料集，透過緊湊神經網路將感測輸入直接映射為包含高階動力學資訊的多項式係數，生成平滑且經驗上無碰撞的軌跡。</li>
</ul>

<hr />

<h2 id="interesting">Interesting</h2>

<h3 id="is-visual-prompting-all-you-need-studying-vlm-spatial-reasoning-under-progressive-visual-scaffolds">Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds</h3>
<ul>
  <li><strong>作者</strong>：Lars Benedikt Kaesberg, Tianyu Yang, Florian Valentin Wunderlich, Terry Ruas, Jan Philip Wahle</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.21170</li>
  <li><strong>來源</strong>：arXiv (cs.AI, cs.CV)</li>
  <li><strong>重點說明</strong>：在 SPaRC 網格空間規劃基準下，研究視覺提示（Visual Prompting）與漸進式視覺鷹架（Visual Scaffolds）對 VLM 空間推理能力的影響。探索了在不改變底層推理任務的情況下，調整輸入端的視覺呈現方式如何影響視覺定位與規劃表現。</li>
</ul>

<h3 id="imu-free-body-frame-state-estimation-with-sparse-scene-flow-for-quadcopters">IMU-Free Body-Frame State Estimation with Sparse Scene Flow for Quadcopters</h3>
<ul>
  <li><strong>作者</strong>：Daniel Grønhaug, Sofie Markeset, Mathias Kolberg</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.20891</li>
  <li><strong>來源</strong>：arXiv (cs.RO, cs.CV)</li>
  <li><strong>重點說明</strong>：提出一種無需慣性測量單元（IMU）的四軸飛行器機身座標系狀態估計系統。僅依賴雙目相機與推力指令，在複合流形狀態上利用連續-離散擴展卡爾曼濾波器（EKF）估計位姿、速度、角速度與重力擾動。</li>
</ul>

<h3 id="a-modular-agent-for-reliable-and-auditable-spatial-relation-verification-in-ct-scans">A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans</h3>
<ul>
  <li><strong>作者</strong>：Simon Vincent Abel, Heiko Hillenhagen, Michael Götz, Timo Ropinski, Ayhan Can Erdur</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.21140</li>
  <li><strong>來源</strong>：arXiv (cs.AI, cs.CV)</li>
  <li><strong>重點說明</strong>：雖然應用於醫學影像，但該模組化代理專注於解決 VLM 在 3D 體積影像中空間關係推理不穩定與視覺證據對齊不足的問題，其模組化驗證架構可為具身感知中的 3D 空間關係驗證提供跨領域參考。</li>
</ul>

<hr />

<h2 id="idea-sparks">Idea Sparks</h2>

<h3 id="觀察一vla-模型的閉環延遲與物理安全防護的交集">觀察一：VLA 模型的閉環延遲與物理安全防護的交集</h3>
<p><code class="language-plaintext highlighter-rouge">2608.21247</code> 聚焦於透過最小可覺差進行 Token 壓縮以滿足閉環控制的延遲要求，而 <code class="language-plaintext highlighter-rouge">2608.20791</code> 則透過多個確定性遮罩進行動作驗證以防範物理擾動。這兩者在部署時存在潛在的運算衝突——安全驗證通常需要多次前向傳播或遮罩運算，而 Token 壓縮則旨在降低計算量。</p>
<ul>
  <li><strong>後續研究問題</strong>：是否能將確定性遮罩機制作為 Token 壓縮中的顯著性先驗，在僅保留未被擾動且具備高語義貢獻的 Token 子集下，同時實現可驗證的安全性與低延遲動作推論？</li>
</ul>

<h3 id="觀察二靈巧操作中的硬體形態適應與時序多模態表徵">觀察二：靈巧操作中的硬體形態適應與時序多模態表徵</h3>
<p><code class="language-plaintext highlighter-rouge">2608.20546</code> 透過夾爪與資料收集工具的協同設計來降低資料收集難度，而 <code class="language-plaintext highlighter-rouge">2608.21290</code>（VT-MUSE）則強調視觸覺接觸在時序演化上的跨模態對齊。硬體端的接觸幾何變化會直接改變觸覺感測訊號的時序動態特徵。</p>
<ul>
  <li><strong>後續研究問題</strong>：在硬體協同設計（如 Koala Gripper）的迭代過程中，如何利用時序視觸覺預訓練表徵（如 VT-MUSE）作為形態適應的評估指標，以量化不同夾爪幾何形狀對跨模態接觸特徵學習效率的影響？</li>
</ul>

<h3 id="觀察三幾何空間提示與動態世界模型的結構解耦">觀察三：幾何空間提示與動態世界模型的結構解耦</h3>
<p><code class="language-plaintext highlighter-rouge">2608.21170</code> 顯示輸入端的幾何視覺鷹架可顯著影響 VLM 的空間規劃推理，而 <code class="language-plaintext highlighter-rouge">2608.20936</code> 則透過圖運算子將物理形態參數與環境狀態轉移解耦。</p>
<ul>
  <li><strong>後續研究問題</strong>：若將視覺鷹架（結構化幾何提示）直接嵌入圖運算子世界模型的節點特徵中，是否能進一步提升世界模型在未見過之幾何障礙物與機器人形態變更下的外推預測能力？</li>
</ul>
]]></content:encoded>
    </item>
    
    <item>
      <title>每日論文雷達｜2026-08-21</title>
      <link>https://tbdavid2019.github.io/paper-daily/posts/2026/08/21/daily-paper-scout/</link>
      <guid isPermaLink="true">https://tbdavid2019.github.io/paper-daily/posts/2026/08/21/daily-paper-scout/</guid>
      <pubDate>Fri, 21 Aug 2026 08:00:00 +0800</pubDate>
      
      <category>embodied_ai</category>
      
      <description>今日概況</description>
      <content:encoded><![CDATA[<h2 id="今日概況">今日概況</h2>

<ul>
  <li><strong>日期</strong>：2026-08-21</li>
  <li><strong>追蹤主題</strong>：具身智能（Embodied Intelligence）</li>
  <li><strong>文獻統計</strong>：
    <ul>
      <li>總檢索篇數：770 篇（經去重後為 664 篇；時間窗口候選篇數為 627 篇，排除已處理篇數後，新增候選為 212 篇）</li>
      <li>關鍵字命中與入選：26 篇（本日精選呈現 10 篇代表性文獻）</li>
      <li>各來源分佈：Hugging Face (100)、arXiv cs.RO (159)、arXiv cs.AI (250)、arXiv cs.CV (250)、arXiv 關鍵字檢索 (11)</li>
    </ul>
  </li>
</ul>

<hr />

<h2 id="must-read">Must-Read</h2>

<blockquote>
  <p><em>本日無達到 Must-Read 門檻（評分 ≥ 80）之文獻。</em></p>
</blockquote>

<hr />

<h2 id="highly-relevant">Highly Relevant</h2>

<h3 id="orthoskillvla-continual-skill-learning-via-gradient-informed-skill-subspace-adaptation"><a href="https://arxiv.org/abs/2608.19589">OrthoSkillVLA: Continual Skill Learning via Gradient-Informed Skill Subspace Adaptation</a></h3>
<ul>
  <li><strong>作者</strong>：Jiaqi Wang, Zhou Fang, Qiongfeng Shi, Yi Zhou</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.CV</code>, <code class="language-plaintext highlighter-rouge">arxiv_keyword</code></li>
  <li><strong>論文重點與關聯</strong>：
    <ul>
      <li><strong>摘要證據</strong>：預訓練視覺-語言-動作（VLA）模型在循序適應不同技能時，容易擾動既有表徵與速度映射，產生災難性遺忘（catastrophic forgetting）。既有基於架構隔離的方法會增加推論開銷，而正交子空間約束方法則常對整個模型施加單一統一約束。本研究分析了 VLA 內部各組件的不同角色（其餘具體架構細節在摘要中未完全提供）。</li>
      <li><strong>研究關聯</strong>：對於專注於 VLA 模型持續學習與技能擴展的研究者而言，該方法探討如何在不顯著增加推論負擔的情況下，透過子空間適應減少新舊技能間的干擾。</li>
    </ul>
  </li>
</ul>

<hr />

<h2 id="interesting">Interesting</h2>

<h3 id="safebranch-branch-pair-safety-alignment-for-embodied-agents"><a href="https://arxiv.org/abs/2608.19729">SafeBranch: Branch-Pair Safety Alignment for Embodied Agents</a></h3>
<ul>
  <li><strong>作者</strong>：Hyunse Lee, Jiwoo Jeong, Haneul Lee, Kyochul Jang, Youngjae Yu</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.AI</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.CV</code></li>
  <li><strong>重點概述</strong>：基於 VLM 的具身代理在執行指令時常違反安全約束。論文指出安全與任務成功是不同目標，且安全事件僅出現在軌跡中的少數關鍵步驟；標準的模仿或任意安全/不安全軌跡對比難以提供精確的因果信號。為此，作者提出 Branch-Pair 安全對齊方法（具體實作數據資料未提供）。</li>
</ul>

<h3 id="decowam-decoupled-whole-body-world-action-model-for-legged-mobile-manipulation"><a href="https://arxiv.org/abs/2608.20114">DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation</a></h3>
<ul>
  <li><strong>作者</strong>：Siyuan Ma, Boshi Zhang, Yutian Zhang, Qinglian Wu, Jiaqi Zhai</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.AI</code></li>
  <li><strong>重點概述</strong>：針對足式移動操作（Legged Mobile Manipulation），既有世界-動作模型多針對固定基座設計，未明確區分相機自我運動（ego-motion）與基座、手臂動作。DECOWAM 凍結 FastWAM 主幹並訓練殘差適配器（residual adapters），透過條件介面顯式解耦基座與手臂潛在動作。</li>
</ul>

<h3 id="what-matters-for-latent-actions-in-robot-learning"><a href="https://arxiv.org/abs/2608.19613">What Matters for Latent Actions in Robot Learning</a></h3>
<ul>
  <li><strong>作者</strong>：Xizhou Bu, Qingda Hu, Lei Zhou, Lingfeng Zhang, Yingbo Tang</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.CV</code></li>
  <li><strong>重點概述</strong>：潛在動作模型（LAMs）能利用大規模無標註影片作為物理動作的替代表示，但現有研究的評估設定零散且不一致。本文針對機器人操作中的潛在動作學習展開實證研究，系統性探討決定下游操作表現的關鍵設計因素。</li>
</ul>

<h3 id="eximo-vlm-guided-exploration-of-vla-policies"><a href="https://arxiv.org/abs/2608.19891">EXIMO: VLM Guided Exploration of VLA Policies</a></h3>
<ul>
  <li><strong>作者</strong>：Bhavya Sukhija, Oliver Groth, Mohit Shridhar, Tim Hertweck, Michael Bloesch</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">huggingface</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.AI</code></li>
  <li><strong>重點概述</strong>：探討如何即時（on the fly）微調大型 VLA 策略以學習新任務。針對遙操作數據收集成本高且強化學習樣本效率低的問題，提出利用視覺語言模型（VLM）引導 VLA 策略探索的方法。</li>
</ul>

<h3 id="towards-professional-tennis-styles-for-humanoid-robots-with-adaptive-motion-planning-and-tracking"><a href="https://arxiv.org/abs/2608.20087">Towards Professional Tennis Styles for Humanoid Robots with Adaptive Motion Planning and Tracking</a></h3>
<ul>
  <li><strong>作者</strong>：Tao Huang, Ruofei Liu, Xuchen Tang, Xinyin Zhang, Junli Ren</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code>, <code class="language-plaintext highlighter-rouge">arxiv_cs.AI</code></li>
  <li><strong>重點概述</strong>：提出 AdaPT 框架，直接從網球轉播影片中學習發球與對打風格，採用階層式設計將風格化運動學規劃與執行追蹤解耦，以在人形機器人上兼顧動作風格與任務完成度。</li>
</ul>

<h3 id="planning-oriented-end-to-end-autonomous-driving-architectures-evaluation-and-emerging-paradigms"><a href="https://arxiv.org/abs/2608.20111">Planning-Oriented End-to-End Autonomous Driving: Architectures, Evaluation, and Emerging Paradigms</a></h3>
<ul>
  <li><strong>作者</strong>：Yanchen Guan, Xingcheng Liu, Bin Rao, Chengyue Wang, Guofa Li</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code></li>
  <li><strong>重點概述</strong>：回顧以規劃為導向的端到端自動駕駛系統演進，涵蓋行為克隆、特權蒸餾、BEV 向量化規劃、世界模型規劃器以及視覺-語言-動作（VLA）系統的架構轉變與評估機制。</li>
</ul>

<h3 id="hybrid-feedback-sampling-for-sample-efficient-model-predictive-control"><a href="https://arxiv.org/abs/2608.19443">Hybrid Feedback Sampling for Sample-Efficient Model Predictive Control</a></h3>
<ul>
  <li><strong>作者</strong>：Chaoyi Pan, Zeji Yi, John Zhang, Zachary Manchester, Guannan Qu</li>
  <li><strong>來源</strong>：<code class="language-plaintext highlighter-rouge">arxiv_cs.RO</code></li>
  <li><strong>重點概述</strong>：分析基於取樣的 MPC 在高維與開迴路不穩定動力學系統中取樣數隨時間視界指數增長的問題，提出透過優化回授策略實現</li>
</ul>

<hr />

<h2 id="idea-sparks">Idea Sparks</h2>

<p>資料未提供</p>
]]></content:encoded>
    </item>
    
    <item>
      <title>每日論文雷達｜2026-08-20</title>
      <link>https://tbdavid2019.github.io/paper-daily/posts/2026/08/20/daily-paper-scout/</link>
      <guid isPermaLink="true">https://tbdavid2019.github.io/paper-daily/posts/2026/08/20/daily-paper-scout/</guid>
      <pubDate>Thu, 20 Aug 2026 08:00:00 +0800</pubDate>
      
      <category>embodied_ai</category>
      
      <description>今日概況</description>
      <content:encoded><![CDATA[<h2 id="今日概況">今日概況</h2>

<ul>
  <li><strong>日期</strong>：2026-08-20</li>
  <li><strong>主題</strong>：具身智慧（Embodied Intelligence）</li>
  <li><strong>資料統計</strong>：
    <ul>
      <li>爬取總量：760 篇（經去重後為 664 篇）</li>
      <li>時間窗口內候選論文：623 篇（已處理 384 篇，新候選 239 篇）</li>
      <li>今日入選展示論文：10 篇（精選自關鍵字匹配的 22 篇中）</li>
      <li>資料來源分佈：arXiv cs.AI (250)、arXiv cs.CV (250)、arXiv cs.RO (148)、Hugging Face (100)、arXiv keyword (12)</li>
    </ul>
  </li>
</ul>

<hr />

<h2 id="must-read">Must-Read</h2>

<h3 id="the-embodiment-gap-in-robot-foundation-models">The Embodiment Gap in Robot Foundation Models</h3>
<ul>
  <li><strong>作者</strong>：Yukiyasu Domae, Keisuke Shirai, Hanbit Oh, Ryoichi Nakajo, Tomohiro Motoda</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.18433</li>
  <li><strong>來源</strong>：arxiv_cs.RO, arxiv_keyword</li>
  <li><strong>重點與關聯</strong>：
    <ul>
      <li><strong>摘要證據</strong>：機器人基礎模型（RFM）與視覺-語言-動作（VLA）策略常基於擴展定律（Scaling Law）進行討論，但模型在泛化之餘，要實際部署至特定硬體本體仍需額外工作。本文將「可重用模型、表徵或數據」與「在目標機器人上執行」之間的落差正式定義為「具體化落差（embodiment gap）」，並對其成因與影響展開綜述（具體分類細節摘要未完整提供）。</li>
      <li><strong>對研究者的關聯</strong>：該文直擊當前具身基礎模型從預訓練泛化走向真實特定硬體部署的核心痛點，為跨本體策略遷移提供了系統性的概念框架。</li>
    </ul>
  </li>
</ul>

<h3 id="softvtbench-a-deformation-aware-visuo-tactile-dataset-and-benchmark-for-deformable-object-manipulation">SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation</h3>
<ul>
  <li><strong>作者</strong>：Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.18701</li>
  <li><strong>來源</strong>：huggingface, arxiv_cs.RO</li>
  <li><strong>重點與關聯</strong>：
    <ul>
      <li><strong>摘要證據</strong>：針對傳統基準僅評估任務成功率而忽略滑移或過度擠壓等物理互動品質的問題，作者提出了首個具備形變感知的視觸覺數據集與基準 SoftVTBench。該基準包含 4,000 條專家示範與超過 50 種資產（含體積可變形物體），將策略可見的接觸觀測與整個任務期間獨立的物理真值進行配對。</li>
      <li><strong>對研究者的關聯</strong>：為可變形物體操作（Deformable-Object Manipulation）與多模態視觸覺策略學習提供了具備物理真值的高質量評估平台。</li>
    </ul>
  </li>
</ul>

<h3 id="adept-accelerating-dexterity-via-pre-training-and-post-training-using-reinforcement-learning">ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning</h3>
<ul>
  <li><strong>作者</strong>：Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.19182</li>
  <li><strong>來源</strong>：arxiv_cs.RO, arxiv_cs.AI</li>
  <li><strong>重點與關聯</strong>：
    <ul>
      <li><strong>摘要證據</strong>：本文提出 ADEPT 大規模強化學習（RL）框架，用於實現高自由度（DoF）機器人從原始視觸覺感知直接學習可跨 Sim-to-Real 遷移的靈巧操作。該方法先在通用物體位姿調整（reposing）任務上預訓練靈巧策略，再以此行為作為先驗進行下游策略的後訓練（post-training），以解決多指機器人從頭學習困難且重複學習技能的問題。</li>
      <li><strong>對研究者的關聯</strong>：展示了「預訓練 + 微調」範式在高自由度靈巧手操作與視觸覺閉環控制中的具體可行性。</li>
    </ul>
  </li>
</ul>

<hr />

<h2 id="highly-relevant">Highly Relevant</h2>

<h3 id="gs-vla-plug-and-play-viewpoint-canonicalization-for-frozen-vla-policies-via-gaussian-splatting">GS-VLA: Plug-and-Play Viewpoint Canonicalization for Frozen VLA Policies via Gaussian Splatting</h3>
<ul>
  <li><strong>作者</strong>：Yechan Park, HyunJin Kim</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.19066</li>
  <li><strong>來源</strong>：arxiv_cs.AI, arxiv_cs.CV</li>
  <li><strong>重點</strong>：針對 VLA 策略對相機視角偏差極度敏感的問題（實驗指出相機支架微小位移可使 LIBERO 基準成功率從約 90% 降至約 10% 左右），提出首個直接利用 3D Gaussian Splatting 進行新視角合成的即插即用框架，在無需重新訓練凍結策略的前提下規範化觀測空間。</li>
</ul>

<h3 id="revisiting-the-push-t-robot-manipulation-task-with-agentic-robotics">Revisiting the “Push-T” Robot Manipulation Task with Agentic Robotics</h3>
<ul>
  <li><strong>作者</strong>：Shuangyu Xie, Kaiyuan Chen, Ken Goldberg</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.18227</li>
  <li><strong>來源</strong>：arxiv_cs.RO</li>
  <li><strong>重點</strong>：重新審視經典的 Push-T 基準，探索利用 LLM 程式碼代理（Claude Code 搭配 Fable 5）在完全不需要示範數據的情況下自動生成演算法解決方案（Code as Policy），並將其結果與視覺動作模仿學習策略進行比較分析。</li>
</ul>

<h3 id="da-wam-decision-aligned-future-latents-for-driving-world-models">DA-WAM: Decision-Aligned Future Latents for Driving World Models</h3>
<ul>
  <li><strong>作者</strong>：Ruiguo Zhong, Benshan Ma, Xiaolong Chen, Lang Zhang, Mingyue Feng</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.19085</li>
  <li><strong>來源</strong>：arxiv_cs.RO, arxiv_cs.AI</li>
  <li><strong>重點</strong>：針對現有自動駕駛世界模型將未來表徵學習與規劃優化解耦、導致動作特定後果被稀釋的問題，提出決策對齊（Decision-Aligned）的未來潛在空間建構方法，確保預測出的未來狀態能直接引導軌跡選擇。</li>
</ul>

<h3 id="lt-mem-volatility-aware-spatio-temporal-memory-for-lifelong-scene-understanding">LT-Mem: Volatility-Aware Spatio-Temporal Memory for Lifelong Scene Understanding</h3>
<ul>
  <li><strong>作者</strong>：Yumin Lee, Hyoseok Ju, Giseop Kim</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.19059</li>
  <li><strong>來源</strong>：arxiv_cs.RO, arxiv_cs.CV</li>
  <li><strong>重點</strong>：針對機器人長期運作中歷史被覆蓋或跨工作期（cross-session）物體識別不一致引起的「時間遺忘症」，提出結合空間對齊 3D 實例感知與揮發性條件（volatility-conditioned）演化的時空記憶架構，支援跨會話物體軌跡查詢。</li>
</ul>

<hr />

<h2 id="interesting">Interesting</h2>

<h3 id="beyond-placement-and-articulation-usage-driven-code-scenes-for-embodied-interaction">Beyond Placement and Articulation: Usage-Driven Code Scenes for Embodied Interaction</h3>
<ul>
  <li><strong>作者</strong>：Zijian Xiao, Zipeng Ye, Jinkun Hao, Xiong Yang, Yuchen Xie</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.18840</li>
  <li><strong>來源</strong>：arxiv_cs.RO, arxiv_cs.CV</li>
  <li><strong>重點</strong>：提出 RoomWright 框架，將室內場景完全表示為可執行的程式碼，並從單純的幾何放置與關節鉸接轉向基於功能用途（usage-driven）的物件推理，生成支援具身互動的模擬環境。</li>
</ul>

<h3 id="partition-the-support-reconstruct-the-residual-training-free-sparse-attention-for-video-generation-and-world-models">Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models</h3>
<ul>
  <li><strong>作者</strong>：Pardis Taghavi, Reza Langari, Gaurav Pandey</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.18484</li>
  <li><strong>來源</strong>：arxiv_cs.AI, arxiv_cs.CV</li>
  <li><strong>重點</strong>：提出名為 SparsePR 的免訓練區塊稀疏注意力機制，透過響應耦合分區與探針擬合殘差重構，降低注意力運算開銷，可用於加速視訊生成與世界模型的計算效率。</li>
</ul>

<h3 id="grabvg-graph-attentive-binding-for-visual-grounding-in-uav-imagery">GrabVG: Graph-Attentive Binding for Visual Grounding in UAV Imagery</h3>
<ul>
  <li><strong>作者</strong>：Chaowei Wang, Yan Di, Jingjun Sun, Baozhe Liu, Jiaxu Tian</li>
  <li><strong>連結</strong>：https://arxiv.org/abs/2608.18996</li>
  <li><strong>來源</strong>：arxiv_cs.AI, arxiv_cs.CV</li>
  <li><strong>重點</strong>：針對無人機鳥瞰視角下密集小型目標與拓撲歧義問題，提出基於圖注意力機制的視覺定位方法，強化實例間細微差異識別與空間拓撲結構利用。</li>
</ul>

<hr />

<h2 id="idea-sparks">Idea Sparks</h2>

<h3 id="1-視觸覺感知與物理真實性評估的閉環結合">1. 視觸覺感知與物理真實性評估的閉環結合</h3>
<ul>
  <li><strong>跨論文觀察</strong>：<code class="language-plaintext highlighter-rouge">SoftVTBench</code> 指出傳統強化學習或模仿學習常因缺乏接觸真值而導致過度擠壓或滑移，而 <code class="language-plaintext highlighter-rouge">ADEPT</code> 則成功透過通用任務預訓練與原始視觸覺感知實現了高自由度靈巧手的跨本體遷移。</li>
  <li><strong>後續研究問題</strong>：若將 SoftVTBench 所建立的形變程度與接觸滑移等物理約束訊號，轉化為 ADEPT 強化學習預訓練或後訓練階段的獎勵懲罰項，是否能在維持 Sim-to-Real 靈巧度的同時，顯著降低高自由度機械手操作脆弱/可變形物體時的損壞率？</li>
</ul>

<h3 id="2-觀測空間幾何規範化-vs-符號化程式碼策略">2. 觀測空間幾何規範化 vs. 符號化程式碼策略</h3>
<ul>
  <li><strong>跨論文觀察</strong>：<code class="language-plaintext highlighter-rouge">GS-VLA</code> 透過 3D Gaussian Splatting 在觀測端進行視角規範化來適應凍結的 VLA 策略；而 <code class="language-plaintext highlighter-rouge">Revisiting Push-T</code> 則顯示 LLM 代理可以直接編寫控制程式碼來解決操作任務，完全跳過神經網路策略的視角依賴。</li>
  <li><strong>後續研究問題</strong>：在面對相機外參大幅變動或動態視角場景時，採用 3DGS 觀測重建輸入給神經策略，與利用視覺語言模型直接生成基於幾何不變量的執行程式碼（Code-as-Policy），兩者在泛化邊界、推論延遲與失敗恢復能力上有何具體差異？</li>
</ul>

<h3 id="3-長期揮發性記憶與世界模型決策對齊的融合">3. 長期揮發性記憶與世界模型決策對齊的融合</h3>
<ul>
  <li><strong>跨論文觀察</strong>：<code class="language-plaintext highlighter-rouge">DA-WAM</code> 強調世界模型預測的未來潛在空間必須與即時動作決策緊密對齊，而 <code class="language-plaintext highlighter-rouge">LT-Mem</code> 則專注於長期環境演化中物體位置與狀態的揮發性時空記憶維護。</li>
  <li><strong>後續研究問題</strong>：如何將 LT-Mem 的實例級揮發性時空記憶作為先驗狀態注入 DA-WAM 的決策世界模型中，使具身智能體在規劃未來軌跡時，能同時基於短期動態反饋與跨工作期的物</li>
</ul>
]]></content:encoded>
    </item>
    
  </channel>
</rss>
