聚焦孤独症等强交互场景,这家公司正在定义机器人“社交”

“ 让机器人走进人类社会。


01.

机器人走进人类社会,为什么多模态“社交”最为重要?


机器人会聊天,就算会“社交”了吗?


当具身机器人走进真实的服务现场,一个招手的动作、一束寻求帮助的目光,甚至语气里的迟疑,都可能改变机器人下一步的回应。它需要结合语言、表情和动作,判断何时开口、何时等待,并随人的反馈调整互动。


依托华中科技大学团队成果转化成立的武汉慧力科机器人有限公司,正专注于这一方向。公司以自研VLI多模态具身交互模型为核心,围绕多模态感知、交互决策与协同表达,探索机器人如何理解人的状态、调整社交策略,并在真实场景中持续完成专业服务。


图 1 慧力科机器人LOGO


02.

从 L0 到 L5,定义机器人交互的能力边界


慧力科以机器人承担的任务与人工介入方式为主线,将社交交互能力划分为L0至L5六个等级。框架同时考察系统主动性、多模态协同、个体记忆和场景复杂度,明确每一级需要完成的交互任务,为产品研发、场景选择与效果评价提供共同尺度。


L0 听指令 → L1能感知 → L2 懂情景 → L3 面向个体 → L4 面向群体 → L5 非合作交互

图 2 慧力科具身机器人人机交互等级(L0–L5)


L0 工具执行


交互由人发起并控制,机器人根据明确指令或固定脚本执行动作。任务目标、执行顺序和异常处理主要由人决定,系统尚未形成依据对象状态调整交互的能力。遥控、按钮触发和固定动作执行属于这一层级的典型形式。


L1 被动多模态响应


机器人能够在人类唤醒或明确输入后作出回应,可结合语言、视觉和动作进行表达。交互主要围绕当前请求展开,任务推进依赖人的持续引导。多种模态的接入需要进一步形成策略协同,才能支撑稳定的目标闭环。


L2 情境闭环交互


在限定场景或明确目标下,机器人能够通过多轮交互组织任务,结合多模态反馈与过程记忆调整步骤,并形成可记录、可评价的结果。判断重点在于系统能否保持目标、利用已有信息、处理任务分支并完成流程。专业人员设定任务边界,复核结果,并处理超出范围的情况。


L3 个体闭环交互


机器人在场景闭环基础上,结合个体特征、历史反馈与跨会话记忆持续调整策略。前一次互动形成的信息能够影响下一次任务,交互方式随个体变化更新。L3判断重点是同一对象在多次”社交“接触中能否获得连续、适配的回应,以及这些调整是否具有可追溯的依据。


L4 面向群体交互


机器人能够在社会场景中理解参与者关系、任务变化和现场约束,协调多人或多机器人共同参与的交互过程。系统需要在场景授权范围内调整交互对象、轮次和行动。评价重点由单个对象的连续互动拓展到复杂场景中面向群体的协调能力。


L5 非合作式强主动交互


系统不能以对方主动提问、清晰表达或配合预设流程为前提,需要根据对象状态主动创造交流机会,理解微弱或不确定的反馈,并持续调整介入时机、表达方式和任务节奏。儿童孤独症辅助干预是慧力科面向这一层级探索的重点场景,具体互动须遵循专业人员设定的目标与边界。


各级判断应在明确的任务、对象和环境范围内进行,并记录任务结果、多模态协同表现、策略调整依据及人工介入情况。能力等级由可验证的交互过程支撑。慧力科希望通过这套分级与评价主张,逐步建立机器人社交交互的判断尺度,并在实际应用中持续完善。


03.

“以终为始”从 L5 到 L2,落地场景背后的产品思维


慧力科的产品路径,从一个高难度的交互问题出发:当交互对象难以主动表达需求,也难以持续参与交流时,机器人怎样建立并延续互动?儿童孤独症辅助干预,正是公司面向这一问题选择的重点场景。


大部分孤独症儿童在表达需要、理解他人的表情和手势、参与一来一往的交流时存在困难。面对这样的孩子,专业人员需要先找到他感兴趣的事物,创造交流机会,再从一次注视、一个动作或短暂回应中判断下一步:继续引导、耐心等待,还是换一种表达方式。大多时候,普通人也难以和孤独症孩子产生正常交互。


图 3 康复师佩戴慧力科研发数采设备对患儿进行康复


慧力科将这类系统不能以对方主动提问、清晰表达或配合预设流程为前提的互动,称为“非合作式交互”。这里的“非合作”描述的是交互条件,并不意味着孩子有意拒绝配合。它要求机器人主动寻找切入点,理解细微反馈,并根据个体差异持续调整策略,对应公司L5非合作式强主动交互的长期目标。


这一场景的价值,也在于专家如何完成互动。医生、治疗师在什么时候介入,依据什么反馈改变策略,怎样让交流继续,都是模型需要学习的专业经验。在孤独症辅助干预方向,慧力科正与郝燕教授等权威专家开展合作。郝燕教授为英国皇家医学会会士、世界中联优生优育专业委员会常务理事、中国康复学会孤独症康复专委会副主任委员,在儿童发育评估、孤独症诊疗及康复指导方面具有极强的专业积累。


这一合作为慧力科进入孤独症场景提供了三方面支撑:专家指导明确研发方向、专业交互数据支撑模型学习、临床资源连接真实应用需求。团队跟随专家深入问诊与干预现场,理解医生和治疗师如何观察儿童、发起互动、判断反馈并调整策略,已收集覆盖问诊与干预过程的视频、文本等多模态资料,逐步将专业经验整理为模型可学习、机器人可执行的任务与交互方法。


依托专家团队长期服务儿童及家庭所建立的沟通基础,慧力科能够更直接地了解实际需求,连接诊疗与康复场景,为产品试用、反馈收集和持续验证创造条件。专家合作由此贯穿需求定义、数据积累与场景验证,支撑公司面向L5非合作式强主动交互的长期攻关以L5的需求定义技术与数据体系,同时在具备交付条件的场景中形成产品,是慧力科的落地思路。


在武汉昙华林,公司已落地中学生生涯规划交互场景:


由VLI专脑驱动机器人围绕学生的兴趣、困惑和规划目标开展对谈,按照专家框架组织信息、引导表达并形成规划建议,验证L2阶段的多轮交互与目标闭环能力。


在武汉昙华林的中学生生涯规划场景中,慧力科与具有17年教育实践经验、累计服务逾千名学生的文龙老师合作。文龙老师具有计算机与教育心理学背景,曾受邀在哈佛、哥伦比亚大学、宾夕法尼亚大学及国内多所985高校演讲,长期聚焦青少年的学业、心性与生涯融合教育,并形成精细化专属成长方案。


其在北京的实践以长期陪伴为特点,将学科学习、个体理解与成长规划相结合,积累了教学提分与持续跟进学生发展的实践经验。慧力科看重的,正是其中围绕具体学生持续了解、引导和调整的方法:如何发现兴趣与困惑,如何将长期目标拆解为阶段任务,以及如何根据反馈修正规划。


图 4 慧力科昙华林中学生生涯规划门店交互场景


双方以这些教育经验和案例积累为基础,将专家方法转化为VLI驱动的生涯规划交互流程,由机器人辅助学生梳理自身情况、明确目标并形成行动建议,在昙华林验证L2阶段的目标闭环能力。从面向少数家庭的深度私属服务,走向面向更多学生的教育普惠尝试。


在此基础上,团队计划通过跨会话记忆与个体反馈推进L3个体化策略协同,进一步通过场景理解与交互组织能力向L4拓展。各类场景分别积累数据、验证效果,共同支撑多模态感知、交互决策与协同表达等能力的迭代。以高难度需求牵引研发,以阶段性应用形成交付,让长期攻关与实际落地持续相互支撑。


04.

支撑交互能力的 VLI 交互专脑


VLI交互专脑是慧力科的核心技术与产品主体,承载公司对机器人理解人、主动交互与持续服务能力的研发。依托团队在机器人感知与交互、规划控制和本体系统等方向的研究积累,慧力科将视觉感知、语音交互、情感表达与动作生成等单模态及多模态研究成果进一步融合,提出并自主研发VLI多模态具身交互大模型(
Vision-Language-Interaction Model),作为交互专脑的模型核心,将人的状态理解、个体记忆、交互策略决策与协同表达纳入统一框架。


围绕VLI交互专脑,机器人终端承担感知与表达,专家知识、交互数据和场景反馈支撑能力训练与迭代。面向孤独症辅助干预、生涯规划等专业需求,慧力科进一步将专家的知识、工作流程与交互方法融入专脑,形成适配不同任务的专业服务能力,并通过实际应用持续验证与完善,逐步构建可适配不同机器人终端、拓展至多类专业场景的交互底座。


连续情感建模与仿生协同表达


在情感交互研究中,团队提出连续动态情绪表征方法,使情感状态随语言生成同步演化,为持续对话中的情感连贯性与表达调控提供基础。在实体表达方面,团队已研制三代仿人机器人头部,实现眼、口、面部等部位的联动表达,并建立语音与动态唇形的映射方法,将情感与语言转化为可执行的面部动作。


这些研究分别构成情感建模、语音驱动与仿生表达的技术基础。慧力科进一步将其融合至自主研发的VLI多模态具身交互大模型,探索在统一交互策略下协调语言、语调、表情与动作,使机器人能够依据人的反馈调整表达内容、强度与节奏。在孤独症辅助干预场景中,这一能力面向的具体任务,是在专业人员指导下提供清晰、连贯且适合个体的互动示范,让多种表达共同服务于同一个交互目标。


具身动作模型与机器人系统积累


团队在具身操作模型方向开展了DeepThinkVLA等研究,探索结合视觉、语言和推理过程生成机器人动作;在工程端积累了机器人规划控制、多自由度执行机构与整机集成经验。这些成果为交互意图向实体动作的转化提供了方法和验证平台。


面向VLI,相关研究正在与交互策略衔接,使语音、注视、头部姿态和手部动作围绕同一目标协同执行。团队将模型输出、动作时序及终端运行约束一并纳入集成验证,推动算法能力进入真实服务流程。


图 5 慧力科研发的星宝问诊小助手进入门诊


专家方法与个体记忆的场景化转化


慧力科与医院专家推进的合作深入到诊疗观察、发育评估和干预互动过程。团队关注专家依据什么反馈作出判断、何时改变引导方式,以及怎样评价一次互动,再将这些经验整理为任务流程、策略依据和评价要求。


在此基础上,VLI围绕当前任务建立过程记忆,并探索将经授权保留的个体信息、历史互动及专家反馈用于后续策略调整。专业知识、交互经验和个体变化由此进入同一研发流程,为长期服务中的连续判断提供依据。


面向真实交互的多模态数据采集


团队在视觉、触觉与运动状态同步采集方面已有研究积累,并针对交互场景配套研发头戴式采集设备,将第一人称视角、面部表情、语音和人体动作等信息纳入采集方案。其重点是保留专家表达与对象反馈之间的时间关系,使交互过程能够被回溯和分析。


这些数据将结合任务过程、专家评价与模型输出,用于分析交互策略的适用条件,并支持系统迭代。团队正在持续连接专家方法、多模态数据、模型策略与机器人执行,这一跨环节的研发与验证能力,是慧力科形成自身技术特色的重要基础。


05.

从交互框架走向真实服务


对行业客户来说,机器人“社交”能不能成立,关键不在单点演示,而在能否嵌入真实服务流程,形成可交付、可评价、可复制的系统能力。


慧力科围绕“交互模型+机器人终端+场景解决方案”推进产品建设:VLI专脑提供理解、记忆与交互策略能力,机器人终端承担感知和协同表达,专业场景明确任务目标与评价要求。三者缺一不可,只有协同起来,机器人才能从“会社交”走向“能服务”。


图 6 慧力科自研“星归”系列仿生交互人形机器人


从行业视角看,L0至L5框架的价值提供了一套可比较的能力坐标。


它明确系统承担哪些任务、在什么条件下运行、人工在哪些环节介入,也让采购方、场景方和研发方拥有共同语言。对于客户而言,这比“像不像人”更接近决策依据:机器人能不能完成目标闭环,能不能记住个体,能不能适应场景,异常时能不能接管。慧力科希望通过持续部署、过程记录与专业评价,使分级逐步形成可验证、可复用的交互评价方法。


落地路径上,慧力科不是从通用陪伴切入,而是从专业场景建立交付能力。高难场景牵引技术上限,可交付场景验证产品下限。一端以L5非合作式强主动交互为长期目标,在孤独症辅助干预等高难场景中,让模型学习专家如何寻找切入点、理解微弱反馈、调整策略;另一端在L2至L4具备交付条件的场景中形成产品,验证多轮交互、目标闭环、个体化策略和场景协调能力。高难需求定义技术方向,阶段应用形成商业交付,二者共同支撑数据与能力迭代。


因此,从交互框架走向真实服务,本质上是把机器人“社交”从演示能力变成服务能力:既能理解人、调整策略,也能在专业边界内稳定交付。以团队长期技术积累为基础,以专家方法和真实交互数据支撑研发,慧力科正将对机器人“社交”的思考推进为具体的技术框架与产品实践,并持续围绕多模态具身机器人交互能力开展验证,推动机器人真正进入千家万户。


官方联系邮箱:contact@vlicorobot.com

商务合作联系人:方先生 (+86)13308095608【微信同号】 tihong443@vlicorobot.com

展开阅读全文

更新时间:2026-10-10

标签:育儿   孤独症   社交   机器人   场景   定义   公司   能力   策略   专家   目标   反馈   动作   闭环

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号

Top