8月3日,自变量科技(深圳)股份有限公司(以下简称“自变量机器人”)发布HOST框架(Human-to-robot One-Shot Skill AcquisiTion,人类到机器人单样本技能获取)并开源,能让机器人仅观察一段数十秒的人类视频就学会新技能,同时保留已掌握的技能。
据悉,HOST采用了一种开创性的方法:不去将人类动作翻译为机器人动作并试图模仿,而是让机器人先想象执行动作后的结果,再从结果中拆分出需要执行的动作。
这种全新方法的效果令人欣喜:机器人从一段29秒人类视频中学习技能的成功率高达62%,超越零样本基线45%。相比Pi-0.5+微调方案,HOST所需数据量大幅减少,学习技能速度较主流方法提升500倍。
HOST的思路来自认知科学中的“观察学习”理论:人类面对不熟悉的任务时,不需要通过长期练习或者穷举来学习,而是以先验能力在大脑中模拟动作的预期效果,然后执行相应动作。
自变量机器人研究人员受此启发,将HOST的学习方案从“训练时微调循环”变为“推理时技能获取”,让机器人通过观察人类执行任务来学习新技能,仅从一段数十秒的人类视频去学习技能,成功率则远超主流模型经过后训练微调的效果。不仅如此,HOST还能随时调取技能,解决了“灾难性遗忘”的问题。
HOST的核心部分是一个带有视觉预测功能的级联策略模型。它采用双专家MoT架构,如同两个分工明确的大脑:“视觉大脑”(视频专家)专门处理视频画面、定位任务进度、预测未来图景;“动作大脑”(动作专家)负责将预测图景转化为需要执行的动作,并控制执行。
对此,自变量机器人团队表示:“在具身智能走出实验室、走进千家万户的进程中,不应该只靠专业人员采集数据、反复训练来获得新技能。人与人之间通过示范传递技能,是更加自然高效的学习方式。HOST将技能获取从少数人的专业流程,转变为任何人都能用一段视频完成教学。”
目前,HOST的研究论文和代码已经全部开源。未来机器人在家庭劳动时,有望摆脱专业化的数据采集和训练过程,通过直观的人类演示就学会新技能。这将让智能机器人成为真正贴心可用的“家庭伙伴”,让智能机器人服务人类的每一天。
8月3日,自变量科技(深圳)股份有限公司(以下简称“自变量机器人”)发布HOST框架(Human-to-robot One-Shot Skill AcquisiTion,人类到机器人单样本技能获取)并开源,能让机器人仅观察一...[详细]
8月3日,MiniMax正式开源新一代通用多模态生成模型MiniMax H3,摩尔线程、壁仞科技、海光信息三家国产算力厂商同日宣布完成该模型的“Day0”适配,国内用户与开发者可即刻在对应国产算力平台...[详细]
AI巨额投入遭遇重新定价,并不意味着产业逻辑终结,而是标志着竞争正从“拼开支、堆算力”转向“拼成本、拼效率、拼产品和商业回报”。未来能够长期享受估值溢价的,未必是投入最激进的企业...[详细]