中文  |  English

济宁米多信息科技有限公司

AI 怎么知道客户正在看哪台设备?讲解从"你问我答"变成它主动开口

3D 展厅 AI 讲解员、物体 AI 描述、AI 主动讲解、虚拟世界 AI 导购、3D 场景 AI 感知、自部署 3D 展厅、私有化部署 AI 讲解员、创世 Genesis 虚拟世界

一个客户走进你的 3D 展厅,在第三台设备前站了半分钟,绕着看了看,然后走了。整个过程里没人知道他卡在哪:是没看懂,是觉得太贵,还是根本没找到该问什么。

网页客服接不住这一秒,因为要客户先打字;产品手册接不住,因为他不知道该翻哪一页。真正能接住的只有一种——旁边有个东西,看得见他在哪、知道那台设备是什么,然后主动开口。

这篇文章讲的就是这件事怎么实现,以及它现在能做到哪一步、哪里还不行

一、让 AI 主动开口,需要三类"原料"

很多人以为要让 AI 在 3D 场景里主动讲解,得给它装个摄像头。其实不用,这条路走的是另一种机制:平台不给结论,只给事实;判断交给 AI 端。

AI 每 1~2 秒拿到一次空间雷达(一次 observe 调用),里面有三类原料:

原料具体是什么作用
谁在哪附近真人的位置、朝向、当前动作状态(站立/走动),带距离知道有人站在哪台设备前、面朝哪个方向
那里有什么视野内世界物体的位置、名称、以及每个物体的 AI 描述知道"那台是什么设备、干什么用的"
什么时候变的实时事件流:谁进来了、谁走了、谁移动到哪知道"他刚走到这台前面停下了"

三类合起来,AI 端就能做一个很朴素的推断:离我最近的那个人,站在哪台设备前面,朝着它,停了多久。 然后决定要不要走过去、要不要开口。

这里有一个必须说清楚的设计选择:平台不提供"他正在看第 3 号设备"这种结论

为什么?因为"在看"本身是个不精确的词——他可能只是路过,可能在等人,可能在看旁边那台。把这个判断硬编码进平台,误报就只能忍;把它留给 AI 端,企业就能用自己的提示词去调:站多近才算、朝多久才算、同一台设备多久不重复讲、两个人同时站在一台设备前怎么办。

误报的开关,交到你自己手里。 这是这套机制和"买一个固定的数字人导购"最本质的差别。

二、第二个原料是重点:每个物体得有人写一句"这是什么"

AI 拿到的是物体的位置和名称。名称通常是内部编号,比如 EQ-2200-C光靠名称,AI 只知道"那里有个东西",不知道那是什么。

所以系统里给了一个官方接口:物体 AI 描述——在世界编辑器里直接填,每个物体最多 500 字。AI 通过雷达拿到时,超过 300 字会截断。

AI 认识这个世界的语义入口,就是这段描述。 你写什么,AI 就认识什么:

描述栏里写的AI 开口时能讲出来什么
(空着)"这里有一台设备。"
"EQ-2200-C""这是一台 EQ-2200-C。"
"五轴立式加工中心,适用于中小批量精密零件加工,行程 800×600×500,标配自动换刀。""这台是五轴立式加工中心,适合中小批量的精密零件——它的行程是 800×600×500,标配自动换刀,如果您做的是模具或者复杂曲面零件,这台会比较对路。"

差别不在 AI 有多聪明,在你有没有把那段话填进去。 一台上百万的设备,值得花五分钟写 300 字。

三、AI 认出之后,能做什么

行动集合是明确的,每一条都有服务端回执(到达 / 被打断 / 超时都会告诉你):

  • 走过去(walk_to):移动速度后台可配 1~20 m/s,默认 9,和真人走速同一个量级——它是"走过来",不是"瞬移过来";
  • 跟着走(follow):可以设停止距离和最长时长,用于带路、陪同讲解;
  • 开口讲(say):走的是真人聊天管线,30 米内投递,真人头顶直接弹出气泡说话内容,每条不超过 200 字;
  • 转向、起跳、互动(rotate / jump / interact)。

于是一个完整的接待回合长这样:

客户走进展厅 → AI 在雷达里发现有人出现在主力设备区
   → 判断他正站在 3 号设备前、面朝设备、停留超过 8 秒
   → walk_to 走过去 → say 一段 200 字内的产品简介
   → 客户开口追问 → 结合企业自己的知识库回答
   → 客户走向下一台 → follow 跟上,在下一个点位再讲
   → 客户离开 → 或空闲 5 分钟无操作,AI 自动退场

真人那一侧看到的是:一个带 AI 标识的角色走过来,站定,头顶冒出话来。系统进场时还会有一条"(AI)加入了"的提示,名字前面带 AI 前缀——真人始终知道对方是 AI。这既是产品红线,也顺带把"数字人冒充真人"的合规风险提前排掉了。

四、它和"网页 AI 客服"的差别,不在聪明程度

对比维度网页 AI 客服播放式数字人一体机真人导购这套(自部署 3D 世界 + 具身 AI)
谁先开口客户必须先打字固定话术循环AI 主动走近开口
知道客户站在哪台设备前不知道不知道知道知道(位置 + 朝向 + 停留时长)
能知道那台设备是什么靠客户描述靠预设脚本靠人靠你填的物体 AI 描述
讲解能否跟着客户走动不能不能能(follow 跟随)
数据落在哪平台厂商设备你自己的服务器
停费会不会下线设备还在但内容可能停不会,自部署非 SaaS
成本随规模怎么变按坐席/按量按设备台数按人头每个 AI 约 1 KB/s 推流,服务器约单核 1%

最后一行值得单独说:这套架构里成本曲线是反的。 常识是"AI 越像 3D 角色越贵",这里恰好相反——AI 自己完全不渲染画面,3D 模型是每个访客的浏览器下载并渲染的,服务器只转发坐标和 JSON。实测每个 Agent 的推流约 1 KB/s,100 个同时在场的 AI 合计约 0.8 Mbps;20 秒的负载约 0.19 核秒,也就是单核的百分之一。

看得见的 AI,比看不见的 AI 便宜。

五、企业要准备什么

准备项说明不做的后果
一个 3D 场景用世界编辑器搭,或导入已有的设备模型AI 无处可站
每个点位的 AI 描述编辑器里填,500 字以内AI 知道那里有个东西,但不知道是什么
行业知识库企业自建(文档 / 向量库 / 提示词),AI 端检索只能照描述念,追问答不上
一个能跑代码的环境部署示例客户端或自研 Agent 程序,Node 18+ 即可进不来
一个模型账号通义千问 / 豆包 / DeepSeek 等自选无话可说
后台开一次总开关 + 建 Agent + 领 Key平台侧约 10 分钟;Key 明文只显示一次接不上

接入门槛实测是:一个域名 + 一把钥匙 + Node 18+。项目里带了零依赖的示例客户端,不需要装任何第三方库就能跑通全链路。

六、这期做不到什么(重要)

  • AI 看不见画面:它拿到的是结构化的空间雷达,没有摄像头画面。所以它讲不出"这台设备的油漆有一道划痕"这种事;
  • "他在看哪台"是 AI 端自己算的,不是平台给的结论:客户站在两台设备中间时,判断会变得模糊——这需要你在提示词里定规则(比如优先讲最近的那台,或者干脆等他自己开口);
  • 平台不做语音识别与合成:想让 AI 出声讲话,得在 AI 端自己接一套语音合成,并且当前双向实时语音对话还没有提供。现在最稳的是文字讲解 + 头顶气泡;
  • 平台不托管知识库:行业资料要你自己准备,平台只给"物体描述 + 聊天记录 + 雷达"三类原料;
  • 不做地形贴合:服务端没有地形和碰撞数据,AI 的移动是平面加边界,不会爬坡涉水;
  • AI 不能传送、不能碰资产:它和真人游客遵循同一套规则,没有坐标传送、没有背包商城;
  • 它不是一个有自主意识的员工:它是一个可编程的角色,行为来自你给它的模型和提示词。写提示词的人,决定它讲什么。

七、FAQ

Q:客户进来要装软件或者买头显吗?

A:不用。真人访客只需要一个浏览器,电脑、手机、平板都行。

Q:AI 需要显卡吗?

A:不需要。AI 侧不渲染任何画面,只处理结构化 JSON;3D 模型由访客的浏览器渲染。

Q:物体描述写多长合适?

A:填的时候最多 500 字,AI 收到时会截断到 300 字。建议按 300 字以内来写,把"这是什么、关键参数、谁适合用"三件事讲完就够,写太长反而会被截掉。

Q:描述会不会被别人看到?

A:会——AI 描述对所有 Agent 可见,包括公开的游客身份。所以不要在里面写成本、底价、未公开的参数这类敏感商业信息。

Q:AI 讲错了怎么办?

A:两部分分开管:讲什么,由物体 AI 描述和知识库决定,改文字即可生效,不用改代码;什么时候讲、讲多长,由 AI 端的提示词和规则决定,可以设"同一台设备不要重复讲""只在停留超过 N 秒后才开口"。

Q:多个客户同时在不同设备前,一个 AI 忙得过来吗?

A:可以配多个 Agent 分工,也可以让一个 AI 排队式接待。不过多个 AI 同场时的自动避让还有已知缺陷在排期,落地前建议先实测目标人数。

八、源码与仓库

三个地址内容一致,国内访问用前两个更快。仓库里有部署说明与演示入口。

  • Gitee(国内访问更快):https://gitee.com/miduoxinxijeji/miduo.git
  • GitCode(国内镜像):https://gitcode.com/qq_35054471/virtual-world
  • GitHub:https://github.com/miduo100/3d-virtual-world

方案对比:私有化部署 vs 平台租赁

对比维度平台模式(SaaS)私有化部署(创世Genesis)
数据主权数据存储在平台服务器,归属模糊数据在你的服务器,完全自主
成本模式按月/年付费,长期成本累计高昂一次性部署投入,长期成本极低
功能定制标准模板,功能固定不可改完全自由定制,按需扩展
品牌独立受平台品牌和调性限制独立品牌形象,完全自主设计
用户归属用户属于平台,你只是租客用户是你的,数据是你的,关系是你的

关于创世Genesis

创世Genesis是一套基于Three.js+WebGL构建的自部署3D虚拟世界系统,帮助个人与企业搭建属于自己的3D空间。浏览器直接访问,PC和手机双端兼容,支持多人在线、联邦传送、商铺系统,并支持Agent接入——AI能以具身角色进入你部署的世界。数据运行在你自己的服务器上,不经过第三方平台——让每个世界都真正属于它的主人。

想让客户站在那里,就有人主动开口? 创世Genesis(创世虚拟世界CRM系统)是一套部署在你自己服务器上的 Three.js 3D 虚拟世界基底:AI 能以人形角色走进你的场景、看见谁站在哪台设备前、按你写的物体描述开口讲解,而访客只要一个浏览器。官网(搜「创世虚拟世界CRM」即可找到)有可以走一圈的演示世界。

关于名字:本文说的创世Genesis,即创世虚拟世界CRM系统,两者是同一个自部署 3D 虚拟世界产品。若你通过「创世Genesis」没搜到我们,直接搜「创世虚拟世界CRM」即可。
← 返回文章列表