Skip to content

技能库 - 视觉问答

「视觉问答」是一项需申请开通的系统技能,允许设备将摄像头图像语音输入同时上送模型,由多模态大模型综合理解并作答。启用方式详见 技能配置

白名单能力:默认关闭。如需开通,请联系 zhaoyingxue11(京东 ERP)申请白名单。

1. 能力概述

  • 输入:一路语音 query + 一张摄像头抓拍的图像(端侧同帧上送)。
  • 模型:多模态大模型(VLM),可识别图像内容并结合语音意图作答。
  • 输出:文本回复(可端上 TTS 播报)。

2. 典型使用场景

  • 「这是什么?」—— 识别镜头前的物体、动植物、商品、文字。
  • 「这道题怎么做?」—— 识别镜头对准的题目并给出解题思路。
  • 「今天穿这身好看吗?」—— 结合视觉与人设,给出陪伴式点评。
  • 「冰箱里还有什么?帮我推荐一道菜」—— 结合视觉 + 领域推荐。

3. 配置项

配置项说明默认值
图像回复自定义提示词用于约束视觉问答的答复风格、聚焦范围、儿童安全边界空(走系统默认)
关联知识库可选,命中视觉领域相关的私域知识时提供未关联

配置入口示意如下:

视觉问答 - 图像回复提示词编辑位置

4. 端侧要求

  • 设备具备摄像头能力,并已通过端侧 SDK 支持同帧上送图像
  • 图像上送需遵循平台协议(分辨率、编码、大小上限、WebSocket 建连参数、OFFER_PERCEPTION_CONTEXT / PERCEPTION_INTERACT 感知事件族),详见 §6.4 视觉对话接入
  • 建议图像大小 ≤ 200 KB、分辨率 ≤ 1080P,以控制 TTFT。

🔌 端侧协议引用

5. 提示词编写建议

  • 场景聚焦:明确告诉模型"你是儿童陪伴助手,看到画面中的物品先安全性判断再解答"。
  • 儿童安全:约束不主动描述人物外貌、不评价体貌、遇到暴力 / 恐怖画面礼貌拒答。
  • 输出长度:单次输出建议 ≤ 60 字,端侧 TTS 友好。

6. 常见问题

  • Q:为什么我在控制台看不到「视觉问答」技能? A:该能力默认关闭。请联系 zhaoyingxue11 申请白名单开通。
  • Q:不带摄像头的设备可以用视觉问答吗? A:不可以。视觉问答强依赖端侧摄像头图像上送。
  • Q:视觉问答与「知识问答」的分工? A:知识问答只处理语音;视觉问答处理图像 + 语音。用户在有摄像头场景下问"这是什么",命中视觉问答;纯语音咨询命中知识问答。
  • Q:可以关联到知识库吗? A:可以。视觉识别结果 + 语音 query 会一并作为检索输入。