计算机视觉(CV)和自然语言处理(NLP)早先是两个较为d立的研究L域。CV 重点关注如何用计算机代替人眼对目标完成识别、跟踪、测量等任务,对图像进行处理;NLP 则研究计算机如何处理、运用自然语言,包括语言生成、问答、对话等任务。近年来,以深度神经网络为代表的机器学习和模式识别技术被广泛应用于 CV 和 NLP L域,取得了目前先进的效果。
近年来,研究者们试图将动作控制也引入到「视觉-语言」任务的框架中。吴琦将此类任务命名为 V3A(Vision, Ask, Answer, Act),在给定视觉输入后,我们希望机器能够提出问题、回答问题、并通过和人以及机器之间的语言交流执行某些动作。
例如,「Vision+Ask」的任务包含视觉问题生成、根据问题生成查询、图像描述等;「Vision+Answer」的任务包含视觉问答、视觉对话等;「Vision+Act」的任务包含指称表达、视觉对齐(visual grounding)、语言引导的视觉导航、具身视觉问答、具身指称表达等。
| 资料获取 | |
| 服务机器人在展馆迎宾讲解 |
|
| 新闻资讯 | |
| == 资讯 == | |
| » 面向移动机器人路径规划的强化学习改进蚁群 | |
| » 安徽省机器人和具身智能产业场景机会清单 | |
| » 人形机器人产业研究蓝皮书2026-市场四 | |
| » 2026中国科技机器人企业TOP50 | |
| » 2026世界人工智能大会暨人工智能全球治 | |
| » 2025年成都市智能建造人工智能(AI) | |
| » 人工智能管理能力成熟度模型及评估方法:五 | |
| » 基于关键帧的人形机器人面部表情模仿算法: | |
| » 人形机器人面部情感表达技术:表情机器人的 | |
| » 创泽迎宾机器人-27寸双屏商用迎宾机器人 | |
| » 人形机器人发展面临的主要问题:技术瓶颈与 | |
| » 宇树科技:全栈自研人形机器人龙头,运控能 | |
| » 人形机器人的技术布局:核心零部件与整机制 | |
| » 人形机器人的大脑依赖于多模态大模型技术, | |
| » 人形机器人技术与产业发展研究-政策、技术 | |
| == 机器人推荐 == | |
服务机器人(迎宾、讲解、导诊...) |
|
智能消毒机器人 |
|
机器人底盘 |
![]() |