实验室简介
组织架构
实验室领导
学术委员会
学术带头人
智能安全研究
安全学习研究
隐私智能研究
安全智能系统研究
教授/研究员
副教授/副研究员
实验师
博士后
新闻动态
通知公告
开放课题通知
开放课题指南
开放课题公示
【文章导读】在近日,哈尔滨工业大学(深圳)计算机应用研究中心王轩教授、漆舒汉教授课题组两项研究成果获 2026 CAAI International Conference on Artificial Intelligence(CICAI 2026)录用。两项工作分别面向服务场景中的具身手语闭环交互,以及离线到在线的长时程目标条件控制,相关论文为《EmbodiedSign: Closed-Loop Sign Interaction with Lightweight Understanding and Robot-Executable Sign Expression》和《Goal-Conditioned ...
在近日,哈尔滨工业大学(深圳)计算机应用研究中心王轩教授、漆舒汉教授课题组两项研究成果获 2026 CAAI International Conference on Artificial Intelligence(CICAI 2026)录用。两项工作分别面向服务场景中的具身手语闭环交互,以及离线到在线的长时程目标条件控制,相关论文为《EmbodiedSign: Closed-Loop Sign Interaction with Lightweight Understanding and Robot-Executable Sign Expression》和《Goal-Conditioned Discrete Skill Priors for Offline-to-Online Long-Horizon Control》。CICAI 由中国人工智能学会主办,是 CAAI 推荐的 A 类国际学术会议。
论文题目:EmbodiedSign: Closed-Loop Sign Interaction with Lightweight Understanding and Robot-Executable Sign Expression
中文题目:具身手语:基于轻量化理解和机器人可执行手语库的闭环手语交互系统
论文作者:代文杰(第一作者)、肖鑫宇、孙俪倩、吕俊增、漆舒汉(通讯作者)、王轩(通讯作者)
作者单位:哈尔滨工业大学(深圳)计算机科学与技术学院;广东省安全智能新技术重点实验室(哈尔滨工业大学(深圳))
手语是听障群体开展教育、医疗和社会交往的重要语言载体。现有系统多集中于“识别成文本”“屏幕呈现”或调用预定义动作,难以在真实服务场景中同时完成理解、回复生成、标准词条对齐和机器人执行。为解决语言理解与物理表达相互割裂的问题,论文提出 EmbodiedSign,将具身手语交互构建为“手语视频—识别文本—回复文本—标准词条序列—机器人动作轨迹”的完整闭环。
系统首先通过教师—学生蒸馏获得可在机器人侧部署的轻量化手语理解模型;随后融合当前输入、对话历史与场景约束进行上下文感知回复规划;再通过同义词归一、功能词过滤、短语优先匹配和最长匹配切分,将开放式回复映射为标准手语词条;最后从结构化词库中检索和组合关键帧,经连续插值与动作重定向,将手型、腕部和手臂轨迹映射至 Unitree G1 人形机器人与 LinkerHand L10 灵巧手。
图1 EmbodiedSign 总体框架:从手语输入到机器人
执行的闭环
系统构建了包含 5,587 个标准化可执行词条的手语库,并在真实人形机器人平台上开展端到端测试。完整系统总体任务成功率达到 87.5%,语义一致性和标准表达质量分别为 4.24/5 和 4.21/5,平均完整响应周期为 8.0 秒。引入当前输入、对话历史和场景约束后,多轮对话成功率提高 10.0 个百分点;文本规范化模块将标准词条命中率由 72.4% 提升至 89.6%,动作序列可执行率由 76.8% 提升至 88.3%。结果表明,轻量理解、上下文规划、标准化对齐与机器人执行的协同设计,是形成稳定具身手语交互链路的关键。
图2 EmbodiedSign 实验平台与代表性交互案例
代文杰,哈尔滨工业大学(深圳)2025 级博士研究生,研究方向为机器人、具身智能,指导教师为王轩教授。
论文题目:Goal-Conditioned Discrete Skill Priors for Offline-to-Online Long-Horizon Control
中文题目:面向长时程控制的目标条件离散技能先验学习
论文作者:张子健(第一作者)、宋一凡、吴宇琳、漆舒汉(通讯作者)、王轩、张加佳
作者单位:哈尔滨工业大学(深圳)计算机科学与技术学院;广东省安全智能新技术重点实验室(哈尔滨工业大学(深圳));香港中文大学
长时程目标条件控制要求智能体在稀疏反馈下完成迷宫导航、连续物体操作和场景交互等复杂任务。直接在原子动作空间中决策,需要同时处理时间抽象与目标推理;而仅依赖当前状态的技能先验,无法判断“为到达目标,此刻应选择何种技能”。
论文提出向量量化目标条件离散技能先验框架 VQ-GSP:从离线轨迹学习离散技能码本,将连续行为片段压缩为技能索引;利用未来状态进行目标重标记并训练目标条件先验,使其依据当前状态与目标选择技能,再由低层解码器还原为原子动作。针对复杂任务,方法以离线先验初始化高层策略,并通过 KL 正则化在线微调,在吸收环境反馈的同时保持离线数据中的行为结构。
图3 VQ-GSP 总体框架示意图
在 OGBench 的 AntMaze、Cube 和 Scene 三类任务上,VQ-GSP 的零样本策略在 7 个任务上的宏平均成功率为 74,优于 HIQL 的 45;在线微调后达到 88。消融实验确认,目标条件技能选择和离散码本均是性能提升的关键。
张子健,哈尔滨工业大学(深圳)2024 级硕士研究生,研究方向为强化学习与长时程智能决策。
相关研究分别得到国家自然科学基金、广东省自然科学基金及深圳市、广东省相关科研项目支持。
撰写 | 王若可、马天姿
初审 | 黄颖欣
复审 | 漆舒汉
终审 | 王 轩