主题
技能库 - 视觉问答
「视觉问答」是一项需申请开通的系统技能,允许设备将摄像头图像与语音输入同时上送模型,由多模态大模型综合理解并作答。启用方式详见 技能配置。
⚠ 白名单能力:默认关闭。如需开通,请联系 zhaoyingxue11(京东 ERP)申请白名单。
1. 能力概述
- 输入:一路语音 query + 一张摄像头抓拍的图像(端侧同帧上送)。
- 模型:多模态大模型(VLM),可识别图像内容并结合语音意图作答。
- 输出:文本回复(可端上 TTS 播报)。
2. 典型使用场景
- 「这是什么?」—— 识别镜头前的物体、动植物、商品、文字。
- 「这道题怎么做?」—— 识别镜头对准的题目并给出解题思路。
- 「今天穿这身好看吗?」—— 结合视觉与人设,给出陪伴式点评。
- 「冰箱里还有什么?帮我推荐一道菜」—— 结合视觉 + 领域推荐。
3. 配置项
| 配置项 | 说明 | 默认值 |
|---|---|---|
| 图像回复自定义提示词 | 用于约束视觉问答的答复风格、聚焦范围、儿童安全边界 | 空(走系统默认) |
| 关联知识库 | 可选,命中视觉领域相关的私域知识时提供 | 未关联 |
配置入口示意如下:

4. 端侧要求
- 设备具备摄像头能力,并已通过端侧 SDK 支持同帧上送图像。
- 图像上送需遵循平台协议(分辨率、编码、大小上限、WebSocket 建连参数、
OFFER_PERCEPTION_CONTEXT/PERCEPTION_INTERACT感知事件族),详见 §6.4 视觉对话接入。 - 建议图像大小 ≤ 200 KB、分辨率 ≤ 1080P,以控制 TTFT。
🔌 端侧协议引用:
- 整体链路 → §6.4.1 整体链路
- WebSocket 建连参数 → §6.4.2 WebSocket 建连参数
- 图像上传时机与上传 API → §6.4.3 图像上传时机 / §6.4.4 视觉图片上传 API
- 下行感知事件(
OFFER_PERCEPTION_CONTEXT/PERCEPTION_INTERACT) → §6.4.5 下行感知事件(IMAGE)
5. 提示词编写建议
- 场景聚焦:明确告诉模型"你是儿童陪伴助手,看到画面中的物品先安全性判断再解答"。
- 儿童安全:约束不主动描述人物外貌、不评价体貌、遇到暴力 / 恐怖画面礼貌拒答。
- 输出长度:单次输出建议 ≤ 60 字,端侧 TTS 友好。
6. 常见问题
- Q:为什么我在控制台看不到「视觉问答」技能? A:该能力默认关闭。请联系 zhaoyingxue11 申请白名单开通。
- Q:不带摄像头的设备可以用视觉问答吗? A:不可以。视觉问答强依赖端侧摄像头图像上送。
- Q:视觉问答与「知识问答」的分工? A:知识问答只处理语音;视觉问答处理图像 + 语音。用户在有摄像头场景下问"这是什么",命中视觉问答;纯语音咨询命中知识问答。
- Q:可以关联到知识库吗? A:可以。视觉识别结果 + 语音 query 会一并作为检索输入。