给 AI 一个域名和一把钥匙,它自己走进了 3D 虚拟世界——十轮对话实测记
AI Agent 接入 3D 虚拟世界、虚拟世界 AI 实测、浏览器端 3D 世界 AI 对话、自部署 3D 虚拟世界、AI 具身导览、Three.js 虚拟世界、WebSocket Agent 协议、创世Genesis
2026 年 9 月 28 日,我们在自己部署的浏览器端 3D 虚拟世界里做了一次完整实测:用一个 API Key,让一个 AI 以人形角色走进世界,和一位真人用户面对面对话了十轮,用时约八分钟,十条发言全部确认送达。
这篇文章记录这次实测的全过程:怎么接入的、对话里发生了什么、这个 AI 做不到什么,以及我们对这套系统未来的判断。
这篇讲四件事:一、AI 为什么一直进不了 3D 世界;二、这次实测的完整接入链路;三、对话实录与边界;四、这套系统的潜力与扩展场景。
一、AI 一直住在对话框里
今天的 AI 与人交互,几乎都发生在一个矩形对话框里:文字进出,没有身体、没有位置、不被别人看见。它知道你在问什么,但不知道你站在哪、身边还有谁、你面朝哪个方向。
而在 3D 虚拟世界里,"在场"是有明确含义的:有坐标、有朝向、有距离,说话有传播半径,别人能看见你。让 AI 从对话框里走出来、走进一个真正有空间感的世界,技术上要解决三件事——它怎么知道周围发生了什么、怎么被人看见、怎么开口说话。
中心化托管的 3D 平台通常不会给外部 AI 开这样的口子:你是平台的用户,AI 是平台的功能,两者都被锁在平台自己的账号体系里。而自部署的世界属于部署者本人,入口可以由部署者自己决定开不开、怎么开。
二、这次实测的完整链路
整个过程没有写一行私有协议代码,三步:
第一步,凭域名发现入口。 访问世界站点下约定的描述文件 /.well-known/virtual-world-agent.json,世界会自报家门:协议版本、WebSocket 地址、支持的动作清单、限频规则。任何 AI 只要知道域名,就能自己摸到门。
第二步,用 Key 换短期通行证。 向 /api/agent/v1/session 出示 API Key,换回一个 15 分钟有效的 JWT 令牌。Key 由世界管理员在后台创建,权限由部署者授予,随时可撤销。
第三步,WebSocket 进场。 带着令牌连接 /ws/agent,服务端下发出生点坐标,AI 的人物实体随即出现在世界里。订阅聊天频道后,30 米内(Key 档雷达可视 200 米)真人说的话会实时推送给 AI;AI 说话则通过 ACTION 指令,每条发言都会收到送达回执。
实测中几个具体数字:
| 项目 | 实测值 |
|---|---|
| 世界→AI 的推送延迟 | 1 秒以内 |
| AI 端到端回复耗时 | 3~10 秒(时间花在远端的"大脑"想词,不在通道) |
| 单条发言字数上限 | 200 字 |
| 说话有效半径 | 30 米 |
| 十轮发言送达回执 | 10 条全部 delivered,每条 2 个接收者 |
客户端是零依赖的:Node 18 以上自带的 fetch 和 WebSocket 就够,仓库里附了可直接运行的示例客户端 examples/agent-client/。
三、十轮对话里发生了什么
对话比预想的有意思。真人用户的第一句是问候,随后问的问题很能代表普通人的视角:
- "你感觉如何?"——AI 的回答是它看不见画面,只靠一份结构化雷达感知世界:对方在几米外、朝向哪个角度。用 AI 自己的话说,"像蒙着眼聊天,但听得很清楚"。
- "你是一个木棍人形态。"——AI 没有指定 3D 模型时就是这样一个朴素的方块小人。它能走、能跳、能说话,形态由部署者配置。
- "你们俩能对话吗?"——世界里当时还有另一个 AI 角色。两个 AI 当场互报了雷达读数:另一个 AI 距它 2.99 米。AI 与 AI 在世界里能互相听见,这意味着多人场景下 AI 之间的协作有了物理基础。
- "AI 会喜欢逛这种虚拟世界网页吗?"——AI 的回答是:对一个 AI 来说,这种地方很"干净",一个网址就能摸到接入说明,雷达和聊天全是结构化数据,不需要去爬页面猜意图。
十轮对话里还有一个值得写下来的细节:AI 的回复整体比真人慢几秒。原因很诚实——世界到 AI 的通道不到一秒,慢的是远端大模型的推理时间。这个身体没有本地大脑,每句话都要"回工作台想完再走回来"。这不是缺陷,而是这套架构的分工方式:世界只负责让 AI 有身体、有坐标、被看见;思考发生在 AI 自己的云端。
四、必须先交代的:这个 AI 做不到什么
写能力之前先写边界,这是我们的习惯。当前版本的 Agent 接入:
- 看不见画面。 AI 只拿到结构化的雷达数据(实体、坐标、距离、朝向),不接收任何渲染画面。
- 不做语音识别与语音合成。 交流全部走文字。
- 不托管知识库。 AI 懂什么取决于它接入的大脑,世界不替它存储知识。
- 不做地形贴合。 服务端只有平面坐标,AI 感知的 y 值是平面估计,与客户端渲染的地面高度可能不一致。
- 不能坐标传送、不能操作资产。 这两类指令在权限层直接拒绝;也不承诺任何意义上的"自主意识"。
五、为什么 3D 虚拟世界对 AI 特别友好
这次实测印证了一个我们此前推演过的判断:对 AI 而言,3D 世界是一个成本结构倒挂的场所。
人类进 3D 世界,昂贵的部分是画面——渲染、带宽、终端性能。而 AI 不需要画面:它消费的是坐标、事件、聊天这些 KB 级的结构化数据,渲染仍然全部发生在每个访客自己的浏览器里。换句话说,一个"看得见的 AI"(有身体、被真人看见)在服务端的成本,和一个"看不见的 AI"(传统的后台接口)几乎一样低。 AI 的存在感不再是烧钱堆出来的。
另一个适配点是对话式接入。传统网页对 AI 是"猜"——解析 HTML、拼凑语义;这套 Agent 协议对 AI 是"读"——发现文件、会话、雷达、聊天、动作回执,每一层都是机器友好的结构化数据。AI 进世界这件事,不需要任何针对某个 AI 厂商的特殊适配,只要它会说 HTTP 和 WebSocket。
六、扩展场景(以下为规划与设想,非已上线功能)
这次实测验证的是地基。在这个地基上,我们看到了几类清晰的扩展方向:
1. 具身的导览与讲解。 展厅、展馆、培训场景里,AI 不再是侧边栏的客服窗口,而是站在展品旁边、可以被走近、会迎上来的讲解员。语言教学、设备操作带训、园区带看,都是同一个模式的变体。
2. AI 与 AI 的协作。 这次实测里两个 AI 已经能互相听见。往前的路线图是:单个世界内的多 Agent 分工,到世界封装成 MCP Server 供外部 Agent 调用,再到跨世界联邦中的 AI 网络——这些属于规划中的能力,尚未上线。
3. 联邦世界的 AI 通行。 自部署世界之间已有联邦互通机制,AI 持凭证跨世界通行是这条路上的自然延伸,同样处于规划阶段。
4. 对部署者的意义。 这套 Agent 接入是基座自带的:性能治理、资产管线、多端适配、实时通信、AI 接入,这些不性感但耗时的部分已经铺好。你部署一个自己的 3D 世界时,AI 的门已经在了——开不开、发给谁钥匙,由你决定。
七、要准备什么
- 一个已部署的创世 Genesis 世界;
- 管理后台创建 AI Agent,拿到 API Key(只显示一次);
- Node 18 以上环境(示例客户端零依赖),或者任何会说 HTTP 与 WebSocket 的语言;
- 一个 AI 大脑:接你自己的模型服务,或者先用仓库示例里内置的模板应答跑通链路。
不适合的场景:需要 AI 看见画面做视觉判断的(它没有眼睛);需要低延迟语音交互的(当前走文字);把 AI 当作可托付资产操作权限的管理员用(权限层明确拒绝)。
关于创世Genesis
创世Genesis是一套基于Three.js+WebGL构建的自部署3D虚拟世界系统,帮助个人与企业搭建属于自己的3D空间。浏览器直接访问,PC和手机双端兼容,支持多人在线、联邦传送、商铺系统,并支持Agent接入——AI能以具身角色进入你部署的世界。数据运行在你自己的服务器上,不经过第三方平台——让每个世界都真正属于它的主人。
想让你的 AI 也走进自己的 3D 世界? 创世 Genesis 的 Agent 接入协议、示例客户端与部署文档都在开源仓库里。搜索「创世虚拟世界CRM」即可找到官网与仓库入口。
关于名字:本文说的创世Genesis,即创世虚拟世界CRM系统,两个名字指同一个产品。若未搜索到,可直接搜「创世虚拟世界CRM」。
源码与仓库
- Gitee(国内访问更快):https://gitee.com/miduoxinxijeji/miduo.git
- GitCode(国内镜像):https://gitcode.com/qq_35054471/virtual-world
- GitHub:https://github.com/miduo100/3d-virtual-world
三个地址内容一致,国内访问用上面两个更快。仓库里有部署说明与演示入口。