据了解,这篇论文涉及的是计算机视觉(Vision)和自然语言处理(Language)两个领域结合的学术研究,提出了对图像(或图像显著区域)更为细致精确的描述,显示出阿里巴巴在Vision&Language研究方向的持续挖掘。
该论文通过创新的多模态、层次化的递归神经网络(Hierarchical Multimodal LSTM)方法,可以将整个句子、句子中的短语、整幅图像及图像中的显著区域同时嵌入语义空间,并且自动学习出“句子-图像”及“短语-图像区域”间的对应关系,生成包含更多形容词的稠密语义空间,对图像或图像区域进行更详细和生动的描述。
也就是说,计算机以后不仅能说“一只鸟站在树枝上”,还能说出“一只羽翼未丰的小鸟站在春天抽芽的树枝上”、“一只张嘴乞食的小鸟”、“一只小鸟站在抽芽的树枝上,扑腾翅膀学习飞翔”这样更为生动复杂的句子。
论文作者介绍,这一研究将被用于“看图说话(Image Captioning)”任务及其他颇有意义的应用场景。如应用于自动导盲系统,将拍摄的图像转换成文字和语音,以便提示盲人避障。
此外,还能用于“跨模态检索(Cross-media Retrieval)”任务,当用户在电商搜索引擎中输入一段描述性文字如“夏季宽松波西米亚大摆沙滩裙”,系统就能为用户提供最相关的商品。
在本月早些时候,阿里巴巴先后发布三篇论文入选国际多会议ACM MM,四篇论文入选国际计算机视觉与模式识别会议CVPR的消息。
今年3月,阿里巴巴宣布启动NASA计划,要为未来20年研发核心科技。在这一计划的号召下,阿里正在人工智能领域全面发力,在机器学习、视觉识别等领域不断追赶世界顶尖的学术水平。
本文来源于www.gimsh.com