主题
第 2 章 选择接入场景与方案
本章解决两件事:① 你的设备走哪条接入线(5 类硬件场景 + 4 种迁移模式);② 是否需要小程序(可选增强)。
JoyInside 覆盖 7 类硬件,但接入路径只有一条主路——第 3 章从零到跑通。所有场景都建立在主路之上,只是叠加的扩展模块不同。读完本章,你能知道:我的设备走主路 + 哪几个扩展模块,要不要做小程序。
2.0 场景决策树(顶层引导)
先做两个决策,再深入对应小节:
你的设备要做什么?
│
┌──────────────┼──────────────┐
▼ ▼ ▼
纯语音设备 IOT/有屏/打印 已有设备迁移
(2.1) (2.2-2.4) (2.5)
│ │ │
└──────────────┴──────────────┘
│
走第二部分·语音对话接入
(第3章从零到跑通为起点)
│
▼
是否需要小程序端?
(可选增强场景,见 2.6)
│
┌────────┴────────┐
▼ ▼
不需要 需要
(语音接入完) │
走第三部分·小程序接入
(设备端跑通后再做)| 你的情况 | 看哪节 | 接入线 |
|---|---|---|
| 从零做一台语音设备 | 2.1-2.4 | 语音对话接入(第二部分) |
| 已有智能体/设备要迁移 | 2.5 | 语音对话接入(第二部分) |
| 要不要做小程序 | 2.6 | 小程序接入(第三部分,可选) |
| 想知道要多久 | 2.7 | — |
JoyInside 平台基础能力
- 支持连续语音对话或半双工语音对话
- 支持闲聊(闲聊、天气、知识问答、游戏、新闻、音色切换等)
- 支持内容播放:有声书、音乐、故事
- 支持 自定义智能体、自定义指令、自定义内容资源 MCP 接入
- 更多请参见产品技能清单
2.1 纯语音设备(玩具 / 音箱 / 教育硬件)
硬件形态:毛绒玩具、点读笔、音箱、教育硬件等 + AI 硬件机盒,无其他外设(除麦克风、扬声器)。
系统架构: 
你要走的路:
| 步骤 | 章节 | 说明 |
|---|---|---|
| 主路径 | 第 3 章 JoyInside 接入预览 | 必走,跑通第一轮语音对话 |
| 协议理解 | 第4章 语音对话协议 | 跑通后回来读 |
| 设备端适配 | 第5章 设备端适配 | 选交互模式(全双工/按键/半双工),配声学算法,音频处理链路 |
| 高级能力(可选) | 运营平台高级功能 | 音色复刻、交互策略 |
纯语音是最基础的接入形态,不涉及指令控制或内容生成,只做"说话—回复"。大多数玩具类设备到此即可。
2.2 IOT 控制设备(家电 / 灯具 / 机器人)
硬件形态:家电(灯具/空调/扫地机)、3C、机器人、舵机控制玩具等,需语音驱动设备动作。
系统架构: 
你要走的路:
| 步骤 | 章节 | 说明 |
|---|---|---|
| 主路径 | 第 3 章 JoyInside 接入预览 | 必走 |
| 协议理解 | 第4章 语音对话协议 | 重点读 4.3 WS 事件(CALL_SKILL_EVENT) |
| 设备端适配 | 第5章 设备端适配 | |
| IOT 指令扩展 | 第6章 §6.1 指令与控制 | 核心扩展:分步配置指南 + 任务规划器 + 批量测试 |
IOT 场景的关键是「指令」:用户说话 → 云端识别意图 → 下发 CALL_SKILL_EVENT → 设备端"照做"(不判断语义,直接调用对应功能模块)。指令可经 IOT 平台转发或直达设备。
2.3 有屏设备(双目显示 / 视觉对话)
硬件形态:带双目显示屏的玩具(展示情绪),或具有视觉识别功能的设备。
系统架构:
双目显示
视觉对话
你要走的路:
| 步骤 | 章节 | 说明 |
|---|---|---|
| 主路径 | 第 3 章 JoyInside 接入预览 | 必走 |
| 协议理解 | 第4章 语音对话协议 | |
| 设备端适配 | 第5章 设备端适配 | |
| 视觉对话扩展 | 第6章 §6.4 视觉对话 | needPerception=true / image/report API |
⚠ 视觉识别场景需先联系 JoyInside 运营人员协助申请开通权限,完成视觉识别智能体的接入。
2.4 打印设备(魔法打印)
硬件形态:打印机外设 + AI 硬件。
系统架构: 
你要走的路:
| 步骤 | 章节 | 说明 |
|---|---|---|
| 主路径 | 第 3 章 JoyInside 接入预览 | 必走 |
| 协议理解 | 第4章 语音对话协议 | |
| 设备端适配 | 第5章 设备端适配 | |
| 魔法打印扩展 | 第6章 §6.3 魔法打印 | 按键 A/B 三态机 + contentType=PRINT |
2.5 已有设备迁移(从其他方案迁移到 JoyInside)
如何迁移到JoyInside
- JoyInside 提供基于websocket的ASR+TTS的语音链路,作为硬件设备接入的唯一入口。
- JoyInside也提供了丰富的内置智能体,也支持客户将自己的智能体植入到JoyInside中。
- JoyInside的主意图(路由智能体)根据当前的对话上下文,将用户请求路由到不同的智能体。
- 客户可以根据现有系统架构体系,和自已的智能体体验能力来决定如何接入JoyInside,以及选择哪些内置智能体,选择哪些三方智能体来接入系统。
如果你已有现成的智能体/意图体系,选 4 种迁移模式之一。所有模式都使用 JoyInside 的语音链路(ASR+TTS),区别在「智能体来源」和「控制通道」:
1、意图+自定义智能体
2、意图+复杂整体
3、小程序按键控制
4、语音控制通道分离
| 模式 | 智能体来源 | 控制通道 | 适用 |
|---|---|---|---|
| 意图+自定义智能体 | JoyInside 主意图 + 三方 A2A 接入 | JoyInside 指令 | 用 JoyInside 语音链路和主意图,部分智能体用自己的 |
| 意图+复杂整体 | 三方意图+智能体整体 A2A 封装 | JoyInside 指令 | 有完整意图+智能体体系,想整体植入 |
| 小程序按键控制 | JoyInside + 三方 A2A | 事件反馈机制 | 按键控制为主,通过对话识别意图选智能体 |
| 语音控制通道分离 | 自定义 | 自行实现 mqtt 等 | 控制通道与语音通道分离,自有一套控制链路 |
模式 3 涉及小程序交互面,详见 第8章。
迁移者仍需走通 第 3 章 JoyInside 接入预览 确认基础链路,再按模式对接 A2A/指令。A2A 协议详见 第7章 §7.1。
其他硬件场景
| 场景 | 硬件形态 | 核心差异 |
|---|---|---|
| 双目显示玩具 | 毛绒 + AI 硬件 + 双目屏 | 双目情绪屏幕展示 |
| 舵机控制玩具 | 含舵机 | 复杂动作指令控制 |
| 视觉对话 | AI 硬件 + 视觉识别 | 图像识别 + 对话 |
| 机器人(狗) | 人形/机器狗 | 具身 + 视觉 + 自定义能力 |
2.6 小程序接入决策(可选增强)
小程序是「可选增强」,不是独立接入方式——设备端语音接入是前置条件,小程序用于扩展用户交互面。
⚠️ 京东不提供小程序,需客户自研
JoyInside 不提供成品小程序。京东 AI 星球小程序仅供配网,品牌方/方案商的小程序均需自研。JoyInside 提供的是小程序对接所需的 HTTP 接口。
京东提供的小程序 API 能力
JoyInside 提供 5 类 HTTP 接口供小程序对接(明细见 附录 A):
| API 能力 | 接口 | 用途 |
|---|---|---|
| 音色列表 | A.5 | 查询企业可用音色 |
| AI 角色管理 | 附录 A.4 | 系统/自定义角色 CRUD + 设备绑定(10 个接口) |
| 用户绑定 | A.6 | 用户与设备账号绑定 |
| 聊天记录与报告 | A.7 | 查看对话记录与对话报告 |
| 在线设备管理 | A.8 | 查询在线设备、远程插播 |
据此判断:你的小程序需要哪些能力,就在第9章对接对应接口。接入方案与前置条件见 第8章。
2.7 接入时长预估
各场景典型接入周期(粗估,实际取决于硬件选型、声学调优、场景复杂度):
| 场景 | 总周期 | 说明 |
|---|---|---|
| 纯语音设备 | 1-2 周 | 最快,主路径 + 硬件适配 |
| IOT 控制设备 | 2-3 周 | 主路径 + 指令集配置 + IOT 平台对接 |
| 有屏 / 视觉对话 | 2-4 周 | 主路径 + 视觉权限申请 + 图像上传协议 |
| 打印设备 | 2-3 周 | 主路径 + 打印协议 + 内容生成 A2A |
| 已有设备迁移 | 1-3 周 | 取决于迁移模式,A2A 封装是主要工作 |
| 含小程序 | +1 周 | 在上述基础上叠加小程序接口对接 |
从零到跑通是所有场景的必经里程碑——跑通第一轮语音对话后,再按场景叠加扩展模块。云端跑通点(预览调试)与端侧跑通点(听见 TTS 回复)的分层验证见 第3章 §3.1。
下一步
读完本章,你已经知道自己的设备走哪条路、要不要做小程序。接下来:
- 跑通最小闭环(所有场景必走):第 3 章 JoyInside 接入预览 —— 听见云端回复
- 理解协议(跑通后):第4章 语音对话协议
- 设备端适配:第5章 设备端适配
- 场景扩展(按你的场景选):第6章 业务场景接入
- 小程序接入(可选增强):第8章 小程序接入方案