今年6月,橡木果
機(jī)器人首次完整地向行業(yè)介紹了橡木果“本能驅(qū)動(dòng)”這一技術(shù)路線。對(duì)于整個(gè)行業(yè)而言,這無疑是一條極為新穎、甚至反共識(shí)的路徑。然而,隨著公司技術(shù)成果的不斷驗(yàn)證,我們更加確信,“本能驅(qū)動(dòng)”是通往通用操作智能的一條更快、更優(yōu)雅、且擁有更高上限的路徑。
今天,橡木果機(jī)器人正式推出「Natus AGE-0 具身本能模型」——一個(gè)“即插即用”的底層操作基座模型。它是橡木果“本能驅(qū)動(dòng)”技術(shù)路線下的核心落地成果,旨在為機(jī)器人打造最底層的“操作本能系統(tǒng)”。
Natus,在拉丁語中意為“與生俱來的、天生的”;AGE-0象征著Natus將持續(xù)進(jìn)化,不斷生長(zhǎng)出新的能力。它為機(jī)器人構(gòu)建了一種“本能反射”,使其無需任何數(shù)據(jù)預(yù)訓(xùn)練,即可實(shí)現(xiàn)毫秒級(jí)的自適應(yīng)操作。在我們看來,這是機(jī)器人實(shí)現(xiàn)通用、可靠、類人自主操作的基礎(chǔ),也是我們通往“具身智能涌現(xiàn)”的第一步。
01 人類操作的真相:智能,從來不是“全程思考”
人類,是地球現(xiàn)存已知智能水平最高的生命體。人屬演化譜系已延續(xù)約280 萬年,在接近 95% 的漫長(zhǎng)時(shí)光中,我們的祖先僅依靠感知、應(yīng)激與生存本能存續(xù)。
自然界耗費(fèi)數(shù)億年,持續(xù)打磨生物趨利避害、動(dòng)態(tài)物理交互的底層本能,直至演化后期,靈長(zhǎng)類才逐步孕育高級(jí)認(rèn)知。語言、抽象推理這類上層智能,僅僅是演化晚期誕生的衍生能力。生物不是先擁有思考能力,才學(xué)會(huì)站穩(wěn)、避險(xiǎn)、完成與物理世界的交互。
由此可見,本能是一切高級(jí)智能的底座。大量感知信號(hào)無需高階大腦參與,便可直接觸發(fā)行為。
這正是 Rodney Brooks 在《無表征的智能》(Intelligence without Representation,1991)中提出的核心思想:智能來自漸進(jìn)演化。底層生存應(yīng)激本能先行,后天學(xué)習(xí)能力與高級(jí)認(rèn)知而后形成。構(gòu)建人工智能系統(tǒng),理應(yīng)遵循這一同源的演化路徑。
在Brooks的架構(gòu)中,內(nèi)部層級(jí)并行運(yùn)轉(zhuǎn):高層行為層能夠調(diào)控低層,但低層持續(xù)獨(dú)立運(yùn)行。高層只下發(fā)長(zhǎng)期任務(wù)目標(biāo),并不指定精細(xì)的運(yùn)動(dòng)軌跡;局部的“感知-運(yùn)動(dòng)”閉環(huán)可自主應(yīng)對(duì)環(huán)境實(shí)時(shí)擾動(dòng),無需上層持續(xù)管控。
當(dāng)前的主流具身技術(shù)路線,全力復(fù)刻人類后天習(xí)得的高階認(rèn)知能力——圖像理解、語言解析、語義推理,卻長(zhǎng)期忽略了生物智能最核心的底層邏輯:生命體與生俱來、無需后天學(xué)習(xí)的原生交互本能。
神經(jīng)科學(xué)領(lǐng)域長(zhǎng)達(dá)數(shù)十年的研究同樣證實(shí):高層認(rèn)知中樞定義任務(wù)目標(biāo)與執(zhí)行標(biāo)準(zhǔn);底層脊髓、外周感知反射環(huán)路負(fù)責(zé)毫秒級(jí)接觸調(diào)控,無需意識(shí)介入即可自主完成力位調(diào)控。該通路實(shí)現(xiàn)外界刺激直接映射動(dòng)作輸出,大多繞開大腦高級(jí)認(rèn)知皮層,不依賴環(huán)境表征與復(fù)雜推理規(guī)劃,僅通過近端感知閉環(huán)完成響應(yīng)。
人類之所以能夠在瞬息萬變、充滿隨機(jī)擾動(dòng)的物理環(huán)境中,實(shí)現(xiàn)極強(qiáng)的操作泛化能力,核心依托的是分層雙軌、并行協(xié)同的生物操作機(jī)制:
第一層:大腦任務(wù)規(guī)劃——知識(shí)數(shù)據(jù)驅(qū)動(dòng)
依托視覺、語言與先驗(yàn)經(jīng)驗(yàn),完成任務(wù)意圖理解、目標(biāo)對(duì)象識(shí)別、作業(yè)標(biāo)準(zhǔn)定義與執(zhí)行流程規(guī)劃。該層級(jí)依托海量場(chǎng)景學(xué)習(xí)與經(jīng)驗(yàn)積累,核心解決“要做什么、做到什么標(biāo)準(zhǔn)、按何種步驟執(zhí)行”的認(rèn)知問題。上層規(guī)劃只定義任務(wù)目標(biāo)與宏觀約束,不介入手部精細(xì)姿態(tài)、接觸力度、物體形變、實(shí)時(shí)擾動(dòng)等底層交互細(xì)節(jié),不綁定具體本體結(jié)構(gòu),因此具備極強(qiáng)的通用規(guī)劃能力。
第二層:本體本能執(zhí)行——物理交互驅(qū)動(dòng)
神經(jīng)科學(xué)研究明確證實(shí):接觸層面的反射調(diào)控響應(yīng)速度,顯著快于視覺信號(hào)傳輸至大腦皮層完成認(rèn)知決策的速度。高頻的實(shí)時(shí)物理交互,根本沒有時(shí)間進(jìn)行高階思考與推演計(jì)算,必須依靠感知本能自主調(diào)節(jié)、實(shí)時(shí)動(dòng)態(tài)收斂。
由此可見,人類實(shí)現(xiàn)精細(xì)操作與動(dòng)態(tài)自適應(yīng)發(fā)力,依靠的是觸覺與本體感知所觸發(fā)的本能反射,而非后天習(xí)得的認(rèn)知推理。映射至機(jī)器人系統(tǒng),決定操作成敗、接觸穩(wěn)定性與環(huán)境適配能力的核心,同樣應(yīng)當(dāng)依托一套底層反射調(diào)控機(jī)制,而非高階認(rèn)知。
02 Natus AGE-0:以“不變”應(yīng)萬變
過去三年,全球具身智能行業(yè)形成高度趨同的發(fā)展路線:以數(shù)據(jù)規(guī)模擴(kuò)張驅(qū)動(dòng)模型能力提升,信奉 “數(shù)據(jù)即一切”。 行業(yè)持續(xù)加大數(shù)據(jù)采集、模型參數(shù)與算力投入,實(shí)驗(yàn)室長(zhǎng)時(shí)序演示效果持續(xù)優(yōu)化,但具身機(jī)器人始終難以規(guī)模化落地工業(yè)產(chǎn)線,無法實(shí)現(xiàn)穩(wěn)定、通用的物理操作。行業(yè)陷入典型的閉環(huán)困境:不成熟的模型無法進(jìn)入真實(shí)工況采集高質(zhì)量交互數(shù)據(jù),缺少真實(shí)場(chǎng)景數(shù)據(jù)又進(jìn)一步限制模型迭代成熟。
我們認(rèn)為,造成這一局面的本質(zhì)原因在于預(yù)訓(xùn)練模型的結(jié)構(gòu)性缺陷:視覺與語言擅長(zhǎng)語義理解、場(chǎng)景推理與流程規(guī)劃,卻無法細(xì)膩表征連續(xù)、動(dòng)態(tài)、細(xì)微的觸覺交互與物理接觸特性。強(qiáng)行將毫秒級(jí)的實(shí)時(shí)接觸調(diào)控納入大模型低頻推理鏈路,不僅無法適配物理規(guī)律,還會(huì)極大加重模型負(fù)擔(dān),從根源上限制機(jī)器人的操作穩(wěn)定性與泛化能力。
生物演化規(guī)律早已印證:生物操作的泛化能力是神經(jīng)系統(tǒng)聚焦達(dá)成目標(biāo)結(jié)果,而非機(jī)械記憶與復(fù)刻固定的肢體運(yùn)動(dòng)軌跡。人類操作智能并非數(shù)據(jù)擬合的產(chǎn)物,機(jī)器人物理交互智能,同樣不可能依靠無限數(shù)據(jù)堆疊實(shí)現(xiàn)通用。智能的根基,從不在于海量樣本的記憶,而是在瞬息萬變的環(huán)境里,把握穩(wěn)定不變的交互規(guī)律。
這正是 Natus 具身本能模型的使命。
作為行業(yè)首個(gè)以觸覺感知為核心、復(fù)刻人類操作機(jī)理的通用操作基座模型,Natus AGE-0 徹底摒棄了行業(yè)主流數(shù)據(jù)預(yù)訓(xùn)練范式,不依賴海量場(chǎng)景標(biāo)注、不綁定具體機(jī)器人本體、不局限特定物料工況,而是從觸覺感知、接觸力學(xué)出發(fā),建立操作底層規(guī)律,讓機(jī)器人擁有與生俱來的物理交互本能,實(shí)現(xiàn)跨本體、跨物料、跨工況的零樣本泛化。
它復(fù)刻了人類操作底層邏輯:以不變的物理交互本能,應(yīng)對(duì)萬變的物理場(chǎng)景。通過“信息感知”的刺激直接構(gòu)建出“本能”,即:感知的期望,繼而驅(qū)動(dòng)機(jī)器人自主探索、收斂于該期望,最終自發(fā)涌現(xiàn)出操作行為。
機(jī)器人不需要任何針對(duì)“特定物體、特定工況、特定場(chǎng)景”的預(yù)訓(xùn)練數(shù)據(jù),不需要先“看”1萬張杯子的圖片,才能學(xué)會(huì)“抓杯子”,它天生就知道“當(dāng)感覺到物體要滑落時(shí),應(yīng)該增加抓力”這個(gè)規(guī)則。
例如,在抓取一個(gè)從未見過的物體時(shí),本能會(huì)通過觸覺感知物體“要掉不掉”的滑移感,自動(dòng)調(diào)節(jié)施加一個(gè)“剛剛好的力”,使物體穩(wěn)定地被握住,而無需事先知道物體的重量、材質(zhì)或摩擦系數(shù)。
這與自然界生物演化底層邏輯一脈相承:在同等生存收益下,消耗更少能量的個(gè)體,擁有更大的生存優(yōu)勢(shì)。自然法則留存了以最小代價(jià)、最低能耗完成生存任務(wù)的本能機(jī)制——這正是 Natus 的設(shè)計(jì)內(nèi)核。
Natus 不依賴任何離線的、預(yù)采集的數(shù)據(jù)集,但不意味著它不接觸任何“數(shù)據(jù)”,然而此數(shù)據(jù)與預(yù)訓(xùn)練模型的數(shù)據(jù)完全不同。VLA等預(yù)訓(xùn)練模型收集的是“樣本數(shù)據(jù)”,這些數(shù)據(jù)是脫離物理交互的、靜態(tài)的、被所人類定義的,與真實(shí)物理世界存在“Sim-to-Real”的鴻溝,且無法包含交互過程中豐富的、時(shí)變的力學(xué)信息。
而Natus是在工作中實(shí)時(shí)處理“交互感知信息”,其包含了大量豐富的力學(xué)語義,如物體重量、質(zhì)心、摩擦系數(shù)、表面軟硬、滑移狀態(tài)等。這些信息是在真實(shí)物理世界“探索-交互”的過程中,實(shí)時(shí)在線產(chǎn)生的,是100%真實(shí)、100%與硬件適配的,因?yàn)樗褪菣C(jī)器人自己“摸”出來的。
03 從本能反射到肌肉記憶,端側(cè)響應(yīng)閉環(huán)
Natus AGE?0 的技術(shù)鏈路復(fù)刻人類行為機(jī)理,形成本能反射?行為涌現(xiàn)?經(jīng)驗(yàn)強(qiáng)化的自適應(yīng)、自學(xué)習(xí)操作能力。觸覺與本體感知作為反射刺激的信號(hào)源,經(jīng)由行為組織機(jī)制,使機(jī)器人在不同硬件、復(fù)雜工況下,涌現(xiàn)出主動(dòng)對(duì)環(huán)境開展探索與交互的行為。基于用進(jìn)廢退的生物規(guī)律,交互產(chǎn)生的行為數(shù)據(jù)持續(xù)篩選、沉淀可復(fù)用的有效操作經(jīng)驗(yàn)。
本能反射:與生俱來的自主探索能力
本能是貫穿全部物理交互的恒定底層機(jī)制,無需海量訓(xùn)練、樣本復(fù)刻與場(chǎng)景預(yù)演。機(jī)器人依托感知直接建立任務(wù)期望狀態(tài),觸發(fā)接觸交互之后,自主輸出穩(wěn)定、快速、可控的本體收斂動(dòng)作,構(gòu)成最高效直接的物理交互求解路徑。
該能力區(qū)別于樣本訓(xùn)練的習(xí)得能力,由感知直接觸發(fā),圍繞任務(wù)目標(biāo)構(gòu)建穩(wěn)定的期望收斂狀態(tài),不受機(jī)器人本體結(jié)構(gòu)、物體形態(tài)、工況環(huán)境差異的制約,天然具備通用性、魯棒性與實(shí)時(shí)性。
在本能期望驅(qū)動(dòng)下,機(jī)器人依據(jù)實(shí)時(shí)接觸狀態(tài)自主生成手臂、靈巧手的適配動(dòng)作,無需人工示教、無需場(chǎng)景預(yù)訓(xùn)練,依靠端側(cè)自主交互即時(shí)建立“目標(biāo)期望 — 動(dòng)作收斂”映射關(guān)系。
作為自下而上涌現(xiàn)物理智能的核心底座,本能反射保障機(jī)器人在未知場(chǎng)景、陌生物料、動(dòng)態(tài)擾動(dòng)條件下的操作成功率與運(yùn)行穩(wěn)定性,為高階操作能力的迭代進(jìn)化筑牢底層支撐。
肌肉記憶:持續(xù)沉淀的熟練操作能力
在本能反射的基礎(chǔ)上,機(jī)器人通過持續(xù)端側(cè)自主探索與實(shí)時(shí)觸覺反饋迭代,將零散的瞬時(shí)收斂動(dòng)作沉淀為標(biāo)準(zhǔn)化、高效化的固定操作鏈路,形成機(jī)器“肌肉記憶”。肌肉記憶將原本依賴高頻決策的交互轉(zhuǎn)化為熟練執(zhí)行,大幅提升作業(yè)效率。
肌肉記憶是本能反射的進(jìn)階迭代能力,并非硬件固有屬性,是機(jī)器人經(jīng)過持續(xù)試錯(cuò)交互、感知經(jīng)驗(yàn)沉淀形成的自動(dòng)化執(zhí)行范式。它將“有意識(shí)推演執(zhí)行”升級(jí)為“無意識(shí)自適應(yīng)完成”,大幅降低算力消耗。
本能反射與肌肉記憶形成雙向協(xié)同關(guān)系:本能反射壓低試錯(cuò)成本、夯實(shí)動(dòng)作收斂基礎(chǔ);肌肉記憶進(jìn)一步動(dòng)態(tài)優(yōu)化本能的響應(yīng)強(qiáng)度與適配邏輯,讓原生交互能力更好匹配工業(yè)具體任務(wù)。
Natus 借助這套機(jī)制,讓機(jī)器人先動(dòng)起來,再通過“在線強(qiáng)化”將探索經(jīng)驗(yàn)沉淀下來,從而實(shí)現(xiàn)了從 “零數(shù)據(jù)冷啟動(dòng)” 到 “高效熟練操作” 的自主進(jìn)化。
04 破解“雞蛋悖論”,冷啟動(dòng)構(gòu)建正向飛輪
針對(duì)具身智能當(dāng)前“雞生蛋、蛋生雞”的數(shù)據(jù)與落地困境,我們認(rèn)為,具身智能應(yīng)當(dāng)依照自動(dòng)駕駛商業(yè)落地的發(fā)展路徑,先讓機(jī)器人在真實(shí)世界中“跑起來”,再通過真實(shí)交互產(chǎn)生的數(shù)據(jù)反哺模型,從而形成商業(yè)與技術(shù)的正向飛輪。
Natus AGE-0 賦予機(jī)器人“零數(shù)據(jù)”即可冷啟動(dòng)的本能,使其能以最低的初始成本進(jìn)入工業(yè)現(xiàn)場(chǎng),立刻開始工作,直接解決了當(dāng)前行業(yè)面臨的三重矛盾:
數(shù)據(jù)稀缺:Natus 實(shí)現(xiàn)零數(shù)據(jù)冷啟動(dòng),無需海量預(yù)訓(xùn)練數(shù)據(jù),從零開始即可工作,跳出了“先有數(shù)據(jù)還是先有模型”的死循環(huán)。
場(chǎng)景失效:Natus 具備強(qiáng)大的自適應(yīng)與泛化能力,不依賴預(yù)設(shè)場(chǎng)景模型,在真實(shí)環(huán)境中能自主探索、自適應(yīng),面對(duì)來料公差、物料差異等動(dòng)態(tài)擾動(dòng)時(shí),魯棒性遠(yuǎn)超預(yù)訓(xùn)練模型方案。
實(shí)時(shí)性不足:Natus 基于毫秒級(jí)的本能反射,而非慢速的模型推理,實(shí)現(xiàn)了真正的“實(shí)時(shí)響應(yīng)”,能夠滿足工業(yè)場(chǎng)景對(duì)節(jié)拍和穩(wěn)定性的要求。
正如 Rodney Brooks 所言:“The world is its own best model. The trick is to sense it appropriately and often enough.”
真實(shí)世界本身就是它自己最好的模型。關(guān)鍵在于恰當(dāng)且足夠頻繁地感知它。
Natus 具身本能模型跳出數(shù)據(jù)內(nèi)卷與擬合陷阱,回歸物理交互本質(zhì),以 “端側(cè)反射、自主收斂” 的全新技術(shù)路線,破解數(shù)據(jù)驅(qū)動(dòng)路線泛化差、實(shí)時(shí)弱、可靠性低等落地難題,推動(dòng)具身智能邁入「本能驅(qū)動(dòng)的通用操作時(shí)代」。
【文獻(xiàn)】
1. Bernstein, N. A. (1967). The Coordination and Regulation of Movements.
2. Rodney A. Brooks(1991). Intelligence without representation.
3. Kawato, M. (1999). Internal models for motor control and trajectory planning.
4. Schieber, M. H., et al. (2026). Autogenic spinal excitatory circuit ensures skilled hand movements in primates.
5. McDougle, S. D., et al. (2016). Implications of plan-based generalization in sensorimotor adaptation.
6. Holt, K. G., Saltzman, E., & Kugler, P. N. (1995). Existence of the minimum?energy trajectory in human gait.
7. Brooks, R. A. (1990). Elephants don’t play chess.