AI 怎么知道客户正在看哪台设备?讲解从"你问我答"变成它主动开口
3D 展厅 AI 讲解员、物体 AI 描述、AI 主动讲解、虚拟世界 AI 导购、3D 场景 AI 感知、自部署 3D 展厅、私有化部署 AI 讲解员、创世 Genesis 虚拟世界
一个客户走进你的 3D 展厅,在第三台设备前站了半分钟,绕着看了看,然后走了。整个过程里没人知道他卡在哪:是没看懂,是觉得太贵,还是根本没找到该问什么。
网页客服接不住这一秒,因为要客户先打字;产品手册接不住,因为他不知道该翻哪一页。真正能接住的只有一种——旁边有个东西,看得见他在哪、知道那台设备是什么,然后主动开口。
这篇文章讲的就是这件事怎么实现,以及它现在能做到哪一步、哪里还不行。
一、让 AI 主动开口,需要三类"原料"
很多人以为要让 AI 在 3D 场景里主动讲解,得给它装个摄像头。其实不用,这条路走的是另一种机制:平台不给结论,只给事实;判断交给 AI 端。
AI 每 1~2 秒拿到一次空间雷达(一次 observe 调用),里面有三类原料:
| 原料 | 具体是什么 | 作用 |
|---|---|---|
| 谁在哪 | 附近真人的位置、朝向、当前动作状态(站立/走动),带距离 | 知道有人站在哪台设备前、面朝哪个方向 |
| 那里有什么 | 视野内世界物体的位置、名称、以及每个物体的 AI 描述 | 知道"那台是什么设备、干什么用的" |
| 什么时候变的 | 实时事件流:谁进来了、谁走了、谁移动到哪 | 知道"他刚走到这台前面停下了" |
三类合起来,AI 端就能做一个很朴素的推断:离我最近的那个人,站在哪台设备前面,朝着它,停了多久。 然后决定要不要走过去、要不要开口。
这里有一个必须说清楚的设计选择:平台不提供"他正在看第 3 号设备"这种结论。
为什么?因为"在看"本身是个不精确的词——他可能只是路过,可能在等人,可能在看旁边那台。把这个判断硬编码进平台,误报就只能忍;把它留给 AI 端,企业就能用自己的提示词去调:站多近才算、朝多久才算、同一台设备多久不重复讲、两个人同时站在一台设备前怎么办。
误报的开关,交到你自己手里。 这是这套机制和"买一个固定的数字人导购"最本质的差别。
二、第二个原料是重点:每个物体得有人写一句"这是什么"
AI 拿到的是物体的位置和名称。名称通常是内部编号,比如 EQ-2200-C。光靠名称,AI 只知道"那里有个东西",不知道那是什么。
所以系统里给了一个官方接口:物体 AI 描述——在世界编辑器里直接填,每个物体最多 500 字。AI 通过雷达拿到时,超过 300 字会截断。
AI 认识这个世界的语义入口,就是这段描述。 你写什么,AI 就认识什么:
| 描述栏里写的 | AI 开口时能讲出来什么 |
|---|---|
| (空着) | "这里有一台设备。" |
| "EQ-2200-C" | "这是一台 EQ-2200-C。" |
| "五轴立式加工中心,适用于中小批量精密零件加工,行程 800×600×500,标配自动换刀。" | "这台是五轴立式加工中心,适合中小批量的精密零件——它的行程是 800×600×500,标配自动换刀,如果您做的是模具或者复杂曲面零件,这台会比较对路。" |
差别不在 AI 有多聪明,在你有没有把那段话填进去。 一台上百万的设备,值得花五分钟写 300 字。
三、AI 认出之后,能做什么
行动集合是明确的,每一条都有服务端回执(到达 / 被打断 / 超时都会告诉你):
- 走过去(walk_to):移动速度后台可配 1~20 m/s,默认 9,和真人走速同一个量级——它是"走过来",不是"瞬移过来";
- 跟着走(follow):可以设停止距离和最长时长,用于带路、陪同讲解;
- 开口讲(say):走的是真人聊天管线,30 米内投递,真人头顶直接弹出气泡说话内容,每条不超过 200 字;
- 转向、起跳、互动(rotate / jump / interact)。
于是一个完整的接待回合长这样:
客户走进展厅 → AI 在雷达里发现有人出现在主力设备区 → 判断他正站在 3 号设备前、面朝设备、停留超过 8 秒 → walk_to 走过去 → say 一段 200 字内的产品简介 → 客户开口追问 → 结合企业自己的知识库回答 → 客户走向下一台 → follow 跟上,在下一个点位再讲 → 客户离开 → 或空闲 5 分钟无操作,AI 自动退场
真人那一侧看到的是:一个带 AI 标识的角色走过来,站定,头顶冒出话来。系统进场时还会有一条"(AI)加入了"的提示,名字前面带 AI 前缀——真人始终知道对方是 AI。这既是产品红线,也顺带把"数字人冒充真人"的合规风险提前排掉了。
四、它和"网页 AI 客服"的差别,不在聪明程度
| 对比维度 | 网页 AI 客服 | 播放式数字人一体机 | 真人导购 | 这套(自部署 3D 世界 + 具身 AI) |
|---|---|---|---|---|
| 谁先开口 | 客户必须先打字 | 固定话术循环 | 人 | AI 主动走近开口 |
| 知道客户站在哪台设备前 | 不知道 | 不知道 | 知道 | 知道(位置 + 朝向 + 停留时长) |
| 能知道那台设备是什么 | 靠客户描述 | 靠预设脚本 | 靠人 | 靠你填的物体 AI 描述 |
| 讲解能否跟着客户走动 | 不能 | 不能 | 能 | 能(follow 跟随) |
| 数据落在哪 | 平台 | 厂商设备 | — | 你自己的服务器 |
| 停费会不会下线 | 会 | 设备还在但内容可能停 | — | 不会,自部署非 SaaS |
| 成本随规模怎么变 | 按坐席/按量 | 按设备台数 | 按人头 | 每个 AI 约 1 KB/s 推流,服务器约单核 1% |
最后一行值得单独说:这套架构里成本曲线是反的。 常识是"AI 越像 3D 角色越贵",这里恰好相反——AI 自己完全不渲染画面,3D 模型是每个访客的浏览器下载并渲染的,服务器只转发坐标和 JSON。实测每个 Agent 的推流约 1 KB/s,100 个同时在场的 AI 合计约 0.8 Mbps;20 秒的负载约 0.19 核秒,也就是单核的百分之一。
看得见的 AI,比看不见的 AI 便宜。
五、企业要准备什么
| 准备项 | 说明 | 不做的后果 |
|---|---|---|
| 一个 3D 场景 | 用世界编辑器搭,或导入已有的设备模型 | AI 无处可站 |
| 每个点位的 AI 描述 | 编辑器里填,500 字以内 | AI 知道那里有个东西,但不知道是什么 |
| 行业知识库 | 企业自建(文档 / 向量库 / 提示词),AI 端检索 | 只能照描述念,追问答不上 |
| 一个能跑代码的环境 | 部署示例客户端或自研 Agent 程序,Node 18+ 即可 | 进不来 |
| 一个模型账号 | 通义千问 / 豆包 / DeepSeek 等自选 | 无话可说 |
| 后台开一次总开关 + 建 Agent + 领 Key | 平台侧约 10 分钟;Key 明文只显示一次 | 接不上 |
接入门槛实测是:一个域名 + 一把钥匙 + Node 18+。项目里带了零依赖的示例客户端,不需要装任何第三方库就能跑通全链路。
六、这期做不到什么(重要)
- AI 看不见画面:它拿到的是结构化的空间雷达,没有摄像头画面。所以它讲不出"这台设备的油漆有一道划痕"这种事;
- "他在看哪台"是 AI 端自己算的,不是平台给的结论:客户站在两台设备中间时,判断会变得模糊——这需要你在提示词里定规则(比如优先讲最近的那台,或者干脆等他自己开口);
- 平台不做语音识别与合成:想让 AI 出声讲话,得在 AI 端自己接一套语音合成,并且当前双向实时语音对话还没有提供。现在最稳的是文字讲解 + 头顶气泡;
- 平台不托管知识库:行业资料要你自己准备,平台只给"物体描述 + 聊天记录 + 雷达"三类原料;
- 不做地形贴合:服务端没有地形和碰撞数据,AI 的移动是平面加边界,不会爬坡涉水;
- AI 不能传送、不能碰资产:它和真人游客遵循同一套规则,没有坐标传送、没有背包商城;
- 它不是一个有自主意识的员工:它是一个可编程的角色,行为来自你给它的模型和提示词。写提示词的人,决定它讲什么。
七、FAQ
Q:客户进来要装软件或者买头显吗?
A:不用。真人访客只需要一个浏览器,电脑、手机、平板都行。
Q:AI 需要显卡吗?
A:不需要。AI 侧不渲染任何画面,只处理结构化 JSON;3D 模型由访客的浏览器渲染。
Q:物体描述写多长合适?
A:填的时候最多 500 字,AI 收到时会截断到 300 字。建议按 300 字以内来写,把"这是什么、关键参数、谁适合用"三件事讲完就够,写太长反而会被截掉。
Q:描述会不会被别人看到?
A:会——AI 描述对所有 Agent 可见,包括公开的游客身份。所以不要在里面写成本、底价、未公开的参数这类敏感商业信息。
Q:AI 讲错了怎么办?
A:两部分分开管:讲什么,由物体 AI 描述和知识库决定,改文字即可生效,不用改代码;什么时候讲、讲多长,由 AI 端的提示词和规则决定,可以设"同一台设备不要重复讲""只在停留超过 N 秒后才开口"。
Q:多个客户同时在不同设备前,一个 AI 忙得过来吗?
A:可以配多个 Agent 分工,也可以让一个 AI 排队式接待。不过多个 AI 同场时的自动避让还有已知缺陷在排期,落地前建议先实测目标人数。
八、源码与仓库
三个地址内容一致,国内访问用前两个更快。仓库里有部署说明与演示入口。
- Gitee(国内访问更快):https://gitee.com/miduoxinxijeji/miduo.git
- GitCode(国内镜像):https://gitcode.com/qq_35054471/virtual-world
- GitHub:https://github.com/miduo100/3d-virtual-world
方案对比:私有化部署 vs 平台租赁
| 对比维度 | 平台模式(SaaS) | 私有化部署(创世Genesis) |
|---|---|---|
| 数据主权 | 数据存储在平台服务器,归属模糊 | 数据在你的服务器,完全自主 |
| 成本模式 | 按月/年付费,长期成本累计高昂 | 一次性部署投入,长期成本极低 |
| 功能定制 | 标准模板,功能固定不可改 | 完全自由定制,按需扩展 |
| 品牌独立 | 受平台品牌和调性限制 | 独立品牌形象,完全自主设计 |
| 用户归属 | 用户属于平台,你只是租客 | 用户是你的,数据是你的,关系是你的 |
关于创世Genesis
创世Genesis是一套基于Three.js+WebGL构建的自部署3D虚拟世界系统,帮助个人与企业搭建属于自己的3D空间。浏览器直接访问,PC和手机双端兼容,支持多人在线、联邦传送、商铺系统,并支持Agent接入——AI能以具身角色进入你部署的世界。数据运行在你自己的服务器上,不经过第三方平台——让每个世界都真正属于它的主人。
想让客户站在那里,就有人主动开口? 创世Genesis(创世虚拟世界CRM系统)是一套部署在你自己服务器上的 Three.js 3D 虚拟世界基底:AI 能以人形角色走进你的场景、看见谁站在哪台设备前、按你写的物体描述开口讲解,而访客只要一个浏览器。官网(搜「创世虚拟世界CRM」即可找到)有可以走一圈的演示世界。
关于名字:本文说的创世Genesis,即创世虚拟世界CRM系统,两者是同一个自部署 3D 虚拟世界产品。若你通过「创世Genesis」没搜到我们,直接搜「创世虚拟世界CRM」即可。