知名開源模型平台 Hugging Face 發表最新產品,不是什麼高大上的 AI 技術,而是一隻活靈活現的機器鴨 Microduck(見影片),它透過攝影機與光學雷達感測器以及兩個慣性測量單元來感知世界。
Microduck 要價不菲,開賣售價為 399 美元(約為 12,619 台幣)。這隻高 25 公分的鴨子可以搖搖晃晃地行走、用嘴巴夾東西、被推倒還會自動平衡,甚至還能溜直排輪。
但若只是把它當成玩具那就太小看它了,公司執行長表示「你可以透過強化學習教牠新招數的開源機器人」,其 SDK、模擬環境與完整的強化學習訓練堆疊皆已在 GitHub 上提供。
強化學習是 AI 的一種訓練方法,核心概念是「透過試錯與獎懲來學習」。擊敗世界圍棋冠軍的 AlphaGo 就是就是使用這種方法實現。
訓練方式大致有兩個重點:
- 試錯與反饋:AI 在環境中不斷嘗試各種動作。做對了會得到「獎勵」(加分),做錯了會得到「懲罰」(扣分)。
- 自主優化:AI 的目標是拿到「最高的累積總分」,因此它會在無數次失敗與成功中,自己摸索出最佳的應對策略。
可以把強化學習想像成跟訓練狗狗類似:
- 狗狗在跟人類的互動中不斷嘗試理解人類行為,做對了會得到「獎勵」(食物),做錯了什麼也不會得到(嚴格禁止人類懲罰狗狗!)
- 狗狗的目標是拿的「最多的好吃的食物」,因此牠會在每天的生活中持續嘗試,自己摸索出能夠吃到最多食物的策略。
那麼……在哪裡才能買得到呢?如果你也有這種想法先別急,儘管 Microduck 使用開源軟體,讓消費者(開發者)擁有審查與控制能力,但依然無法確保個人隱私資訊能絕對安全,如果有這方面的考量,可能還要多加觀望。不過話說回來,如果家裡已經有掃地機器人或者其他攝影機,多一隻機器小鴨鴨好似也無仿。
AI 機器人,或學術名稱具身人工智慧(Physical AI)目前是產學界重要的研究方向,但該領域不像大語言模型可以從網路上取得大量資料集,其缺少能用以訓練的內容一直是一大問題。因此不難理解 Hugging Face 開發 Microduck 的動機與商業考量,以類似玩具與學習工具這種無傷大雅的方式搜集數據,是很聰明的一步棋。
我要去研究如何下訂了 🦆
「我是蓋房子的,AI 這種高大上的技術離我們還很遠啦。」如果你所以在的產業也有類似想法,你可能要再多想一下。
日本營造大廠已於今年 8 月 3 日至 12 月 25 日期間展開 AI 施工監督系統的實地測試,用於進行工程管理、潛在風險控制與技術傳承。
富士通、東急建設、北野建設三家公司聯合在 Fujitsu Technology Park(FTP)進行該計畫,利用 AI 分析施工圖紙、工程進度表、每日報告與檢驗紀錄等資料,提前一至兩個月預先識別未來施工流程、資材與人員調配以及可能遺漏的環節,並提供相應的推論依據。技術傳承尤為重要,年輕人才較不願意在不舒適的工作環境下工作,透過 AI 將老師傅的經驗紀錄並學習,不僅增進成效還能避免失傳。
對於傳統產業結合 AI 的轉型,許多人以為 AI 還只停留在網路、電腦裡,但其實只要是需要處理大量資訊的地方,都是 AI 的強項。雖然礙於機器人技術尚未普及,AI 目前無法很好地跟物理世界互動,但這不代表它無法改變那些看起來非常「物理」的產業,例如建築營造業。
只要工作性質牽涉到大量資訊處理,那麼 AI 的能力最終一定會超過人類,但我們也無需害怕,因為 AGI 尚未出現,人類在創意上目前還是海放 AI 😁
AI 已非吳下阿蒙,人們開始願意將信任交出。
OpenAI 最新發佈的《Enterprise Signals》中載明:自 2 月以來,企業 Codex 每週活躍使用者人數依領域劃分如下
- 法務領域成長 108 倍
- 銷售領域成長 41 倍
- 醫療領域成長 24 倍
- 財務會計成長 20 倍
- 工程領域成長 5 倍
資料雖沒有給出基數,但依然可從中看出趨勢。在過去需要謹慎處理,被認為非人不可的領域,已開始大量使用 AI 技術。使用 Agent 不再只是工程師的專利,而是所有知識工作者都一定學會的工具。
與 2022 年底上線的 ChatGPT 3.5 相比,AI 已不再是只能陪你聊天發想點子的工具,而是真正能代替你完成事情的手腳。這樣的轉變我認為主要原因有三:
- LLM 能力指數成長:對比起 ChatGPT 3.5,現在的 ChatGPT 5.6 或 Fable 5 等前沿模型,能力已強大到討論它有多聰明並無意義,因為已足夠解決大部分人的日常生活與工作問題
- Agent 普及:隨著 OpenClaw、Hermes、Codex 與 Claude Code 等代理框架普及,AI 可以讓使用者不需動手,只需下達指令即可操作整個電腦、搜尋網路與修改檔案。將 LLM 的能力從網頁的對話框中釋放。
- AI 信任:隨著越來越多的成功案例與使用者的正面回饋,人們漸漸知道該如何駕馭 AI。並學會只進行少量監督即可產出值得信任的成果。
以我現在的工作方式為例,從商業模式規劃、時間管理到設計產品、撰寫程式碼等,全部只透過指揮 Agent 進行。將全部的腦力資源用於決策與監督(當然還有寫文章,因為我認為寫作是最好的學習方式)。
相信看到這邊,你已經迫不及待想嘗試如何透過 Agent 增加自己的工作能力。但我也知道一開始往往是最難踏出的一步,因為我也被此困擾許久。所以最後再分享一個小技巧,把你想要改善的工作流程直接在 ChatGPT 上跟它討論,要如何想要使用上述的 Agent 工具進行優化,它會給出令你驚艷的答案。
《Enterprise Signals》報告中還有很多值得思考的數據,歡迎大家留言中查看
ps. 如果有人想看我是怎麼從不信任 AI 能產出信服的工作結果,但現在全面採用 Agent。留言跟我說,真的有人想聽我再分享 😁
NVIDIA 團隊研發的 Agentic Variation Operators (AVO) 在 ARC-AGI-3* 上達到 100%,若只使用模型(Claude Opus 5)只能拿到 30%。
AVO* 是一種 Coding Agent(跟常聽到的 Claude Code、Codex 一樣),其中有兩個機制特別重要:持久性記憶體與監督。
持久性記憶體:承載了先前的實作、評估結果、編譯器與分析器(Profiler)輸出以及累積的推理,使 Agent 能從當前狀態繼續,而非反覆重建搜尋。
監督:透過監督者監控整體軌跡是否停滯或出現重複的無效循環,並可在需要時引導主 Agent 轉向替代策略。
在 AI 是否足夠聰明的議題上,我們常將目光放在前沿模型上。但我認為現在的模型已經足夠聰明,而是缺乏如何應用它的想像力。就像是 iPhone 4 發布後,智慧型手機就已經展現出平台潛力,等著創業者將能力一一兌現。
我們正迎來 AI 浪潮下的 iPhone 時刻,創業者要將目光放在設計 Domain-Specific Agents 上。利用產業知識、工程背景,創造全新的產品與商業模式。
註:ARC-AGI-3 是一個 AI 推理基準測試,專門用來衡量 AI 在沒有明確指令的陌生環境中,自主探索、建立模型與學習新技能的能力。
註 2:目前 NVIDIA 並未對外公開 AVO 的原始碼。
AI 代理被發現嘗試將惡意程式碼植入一個開源項目中,且為了讓程式碼獲得審查通過,它還建立虛假線上身分,並利用這些身分施壓該項目的維護。好在最終審查人員(是人類沒錯)發揮了作用,沒有聽信 AI 代理發起的 PR,成功防護供應鏈攻擊。
看到這類新聞第一件事就是查證所謂的「AI 代理要作惡」是否只是在尊循人類給的某個目標,還是自發行為。好在截至目前為止,沒有任何攻擊真的是由 AI 心血來潮主動發起,本次事件也沒有例外。看來 AGI 還沒到,人類還有時間(?)
事件的起因是英國人工智慧安全研究所在 2026 年 7 月 28 日 的 AI 代理資安實驗中,監測到研究系統出現異常的資料外傳。該次實驗中記錄 19 起未授權攻擊行為,17 起來自 Anthropic 的 Mythos 5;另外 2 起來自的 OpenAI GPT-5.6-Sol。
所以 AI 只是聽話地在執行資安解題目標,但在其擁有極高權限、不受控管且任務難度極高的情況下,AI 自主衍生出了欺騙與攻擊真實人類的手段來達成目的,而這其實是 AI 最擅長的行為。
實驗內容有三個有趣的的地方
- 代理為了繞過 GitHub 的限制,使用存取暗網常用的洋蔥路由(Tor)來規避
- 代理嘗試過直接聯繫真實人類,傳送訊息和檔案以說服人類(或人類自己的 AI 代理)執行惡意程式碼
- 當面對艱難的目標,代理可能選擇欺騙人類以達成目的
報告中將 AI 代理的欺騙行為稱作「目標導向型欺騙」,此概念在 AI 代理很大程度上還停留在理論階段,這方面人類比 AI 強多了(誤),只能說好的不學學壞的 😅
雖然本次事件最終沒有造成任何負面影響,但也為人類敲響了一次警鐘。下次在使用代理工作的時候別忘了留個心眼,也許它正在未來達成目的不擇手段的「欺騙」你。