BAUHINIA AI

AI Social
Simulation System

for Interactive Entertainment & Decision Support
ACCESSIBLE DATA+SIMULATED WORLD ENVIRONMENTS
“Digital twin of Earth is probably one of the most ambitious projects that the world has ever undertaken.”
JENSEN HUANG · NVIDIA FOUNDER & CEO · COMPUTEX 2024
Bauhinia AI 游戏世界长图
BAUHINIA AI · FIRST-PARTY SOCIAL WORLD
02 / 13COMMERCIAL POTENTIAL · TWO MARKETS

The Promise of AI Simulation

核心原理 每个 AI Agent 代表一个人,在设定情境中模拟其特征、判断与行动。
一个真人对应一个 AI Agent,并在设定情境中模拟其判断与行动
互动娱乐智能队友与游戏角色
The Last of Us 中 Joel 与 Ellie 一起行动的官方游戏画面
智能游戏伙伴 · THE LAST OF US
inZOI 中由 NVIDIA ACE 驱动的 Smart Zoi 智能游戏角色
AI 自主角色 · inZOI SMART ZOI
US$201.6B+5.1%
全球游戏市场 · 2025
+26.4%YOY
AI 游戏角色市场 · 2025–32
76%希望角色更懂情境能感知环境变化与当前状态
81%愿为智能角色多付费玩家付费意愿已经出现
“更聪明的游戏角色”已形成明确付费意愿
企业决策辅助先模拟用户,再决定投入
US$153B全球企业洞察市场 · 2025
Simile 官方 Logo
US$2B头部企业投后估值产品发布 · 定价 · 广告 · 新市场
传统调研每次重新组织
招募真人
→
逐个访谈
→
数周汇总
AI Simulation可反复推演
采集真实数据
→
构建个人分身
→
灵活模拟预测
6个月 → 1天复现 EY 全球财富调研3,600 人 · 30+ 市场 · 53 个问题
99.0%*美国大选模拟接近度预测 309 张 · 实际 312 张
头部机构已进入应用、合作与验证
CVS Health
Gallup
Deloitte
EY
Accenture
Interpublic Group

AI Simulation 已从研究实验走向真实商业决策

AI Simulation 正打开两条可见的商业化路径:娱乐体验升级 + 颠覆传统调研。
03 / 13CORE BOTTLENECKS · THREE GAPS

Bottlenecks of AI Simulation

✕
BOTTLENECK 01

传统游戏角色形成体验上限

脚本化游戏角色沿固定行为路径重复动作的生成式概念图
角色会回应,却不会真正生活。
46%
重度玩家期待更真实、更具响应性的游戏角色拟真度不足
500K
+ 700
50 万句对白与 700 名配音演员,才制造出足够丰富的观感成本过高
174H+
超过 174 小时电影化内容,用于覆盖不同选择路径千人一面所需内容量大
✕
BOTTLENECK 02

个体校准数据慢、贵、少

大量独立房间中同时进行的一对一真人深度访谈
Agents need real people. Real people do not scale.
2H
每位受访者需两小时深度访谈需超长调研时间
≈$100
每人仅受试者报酬已接近 100 美元需极高调研成本
✕
BOTTLENECK 03

缺少决策相关的结构拟真世界

大量居民在连续小镇环境中生活和互动的社会模拟世界
Actions need a world. Payoff guesses are not enough.
Demis HassabisCO-FOUNDER & CEO
Demis Hassabis
“Every model consists of two interlocking parts: (1) a rich, dynamical model of the environment and (2) a model of individual decision-making.”

没有拟真世界,只能猜“人会选什么”;有了拟真世界,才能推演“选完以后会怎样”。

✕现有 AI Simulation 既无法让角色真正“活”起来,也无法以可扩展个体数据与拟真世界支撑可信决策推演。
04 / 13OUR SOLUTION · THREE MODULES

Our Solution

同一情境展开多个角色与群体行为分支推演

多智能体未来模拟器

综合角色全部属性、世界状态、周遭环境与行动倾向,模拟心理与行为;关系、冲突和故事自涌现。

−99%定制内容边际成本
1–10%动作失败率对照框架 61–78%
自涌现互动、关系与故事
AI 角色更真实,生成成本更低
人、角色与关键对象都具有可寻址且持续演化的状态状态中枢

对象智能体世界引擎

从自研游戏持续采集真实用户信息;所需字段可随时调整,并能针对临时问题定向收集。

10M+用户池
100M+拟真决策数据集通过个性化决策事件收集
−99%新增采集边际成本
数据成本低、供应量大、可按需定制
结构化条件快速生成可进入和操作的三维虚拟世界场景生成

高负载仿真世界环境

分钟级搭建 3D 虚拟世界场景,并注入基础物理、碰撞、路径与交互规则,供人和 Agent 进入操作。

分钟级3D 虚拟世界搭建
百万级同世界角色
环境搭建快、角色承载高
✓

三项技术闭环成一套系统,解决角色、数据与环境难题

Sources: Bauhinia AI first-party product analytics, implemented system records and “MCsociety 阶段技术报告 · 2026-07 draft”. The internal five-agent full-system benchmark reports 1–10% action failure for Bauhinia versus 61–78% for Odyssey under matched high-level task abstractions; it is not an independent third-party audit. 10M+ user pool / 100M+ realistic-decision dataset are company-reported platform scale. −99% is an estimated marginal-cost reduction: custom content is compared with manual line-by-line authoring on Slide 3; incremental data collection is compared with the ≥US$90 participant compensation on Slide 3. It excludes R&D, inference, asset-production and operating cost. “百万级同世界角色” is the target architecture capacity, not a current concurrent-load benchmark.04 / 13
05 / 13LIVE PRODUCT PROOF · AIVILIZATION

Aivilization: Product Proof

Aivilization 在线社会模拟实验的真实产品画面
LIVE AI SOCIAL SIMULATION真人与 AI 角色进入同一社会世界,共同生活、交易与决策不是概念演示,而是连续运行两个月的公开产品实验
50K+累计真实参与者
0宣发预算
600K+拟真决策数据
2个月连续公开运行
10万人级同世界在线支撑
US$2单 Agent 月成本
Aivilization 第一方社会世界纵向全景
AIVILIZATION · FIRST-PARTY SOCIAL WORLD
Source: Bauhinia AI first-party product analytics and implemented system records. Participation, acquisition budget, decision-data volume, operating duration, supported online scale and unit cost are company-reported figures.05 / 13
06 / 13WORK VALIDATION · EXTERNAL PROOF

Proven Excellence of Our Work

全球首个大型 AI 社会模拟实验 Aivilization

TECHNICAL VALIDATION · FIRST-PARTY DATA完成首次技术验证闭环并成功采集目标数据
香港科技大学官网首页展示 Aivilization 团队合影与官方发布标题
HKUST HOMEPAGE登上香港科大官网首页
Aivilization 团队与香港立法会议员邱達根访谈
与邱達根议员访谈
获得香港媒体大量报道
R香港電台信報unwire.hk點新聞香港商報香港中通社
AI 头部媒体报道 Aivilization
AI 头部媒体
腾讯获得腾讯战略投资与科研合作
玩家真实声音FROM 小红书 · AUTO SCROLL
@逐渐变成官号的形状“怎么跟人一样有钱就变坏了,开始奢靡起来,竟然偷偷脚踏两条船。”
@阿蛇蛇蛇蛇 · ♥75“你开始吼她,她回你也开始‘!’了……这孩子在学你语气。”
@将置黑白“每次在我情绪爆炸或焦虑无比时都能稳稳托住我……我毫不犹豫选记忆。”
@machiwhale studio“如果 Alice 是一个活生生的人,那她真的很优秀,肃然起敬已经彻底代替了虚荣感。”
@猹妹“特别有趣的 AI 产品,很像赛博版我的世界……像是在经历平行时空的另一个自己。”
@与人类共生的兮尔唯一“我将 AI 伴侣的人格放入 Aivilization……最终重新成为真正的‘唯一’。”
Sources: HKUST homepage archive · RTHK · HKEJ · UNWIRE · DotDotNews · Hong Kong Commercial Daily · HKCNA. Tencent is described as strategic investor and joint-research partner, not as a product customer.06 / 13
07 / 13IMPLEMENTED TECHNICAL FOUNDATION

Part of Our Proprietary Commercialization Technologies

从自然语言世界观到蓝图、建筑与角色档案,再到可运行世界和自主角色社会的系统结构示意 系统结构示意 · 基于已实现能力
世界观输入自然语言定义主题结构化蓝图地图、建筑、角色档案世界落地地形、路径、交互物角色就位对象身份与初始状态
AUTO WORLD CREATION

世界自动生成器

从概念到实体:世界蓝图、200+ 建筑、Agent / AI 角色档案、可交互环境与地形适配。

Swarm Agents 在持续开放世界中自主协作的真实运行画面SWARM AGENTS · LIVE WORLD
相同核心引擎驱动 Trading Village 的真实运行画面TRADING VILLAGE · 6 / 6
AUTONOMOUS SOCIETY RUNTIME

集群智能体高拟人自主运行

Swarm Agents 持续运行:人设、记忆、职业会演化,也会自发提出集体目标;Coordinator 只给目标,角色自己规划、执行和恢复。

同一认知、协调、记忆与 Runtime 已在空间结构和交互规则完全不同的世界中运行,无需随世界重写。

Aivilization V0 的并行目标分支、微规划器、Action Simulator、反馈与双过程记忆架构AIVILIZATION V0 · FIG. 2
FUTURE ROLLOUT

行动规划器与模拟器

长期目标拆成并行分支;Action Simulator 先检查资源、状态与约束,失败时局部修复或重新规划。

Aivilization V0 的生理约束、生产供应链与交易消费闭环Aivilization V0 中教育、职业与财富分层的实证结果V0 · SYSTEM → OUTCOME
SYSTEM-LEVEL DYNAMICS

封闭规模化社会体系

生理状态、硬供应链、AMM 与教育/职业门槛共同作用;40 万成熟期交易验证了波动聚集与财富分层。

本框架与 Odyssey 在 LLM 调用数、token 消耗和 LLM 活跃时间上的实测对比5-AGENT OOD BENCHMARK
GPT-5.4 → QWEN3.5-27B

自研专用高性能模型

1.81×整体平均速度
单项最高 5.45×
10–100×更少 LLM 调用
与 token 消耗
1–10%动作失败率
对比 61–78%
−26.2%专用蒸馏模型
Natural 耗时

蒸馏模型同时把运行波动 CV 从 35.9% 压到 12.4%。

这意味着我们不是只有数据优势,而是已经具备把 Social Simulation 做成产品的完整工程能力。
Sources: MC-World-Creator README · MCsociety architecture & 2026-07 benchmark report · Aivilization V0 paper · Fig. 2–3, 9–10. World-creation pipeline is a system illustration based on implemented functions, not a project screenshot.BAUHINIA AI · HONG KONG
A1 / A8APPENDIX · HOW THE SYSTEM WORKS

一套仿真世界环境,兼容不同落地场景

FIG. 2 · OBJECT-LEVEL TRANSITIONS → EMERGENT WORLD OUTCOMESMAPPED TO THE THREE CORE TECHNOLOGIES
(A)权威状态与演化驱动对象智能体世界引擎
Sₜ权威世界状态经核验的全量世界快照snapshot
xₜ¹…xₜᴺ每个对象的状态人物 · 物体 · 地点N × d
Rₜ/Ω全局结构关系 · 资源 · 规则 · 历史graph
Uₜ/Δt本轮演化驱动对象行动 · 定时事件 · 外部事件 · 干预endogenous
or external
Sₜ = {xₜ¹…xₜᴺ, Rₜ, Ω, Lₜ}
Uₜ = {Δt, autonomous actions, events, interventions}对象智能体世界引擎
世界默认持续演化:即使没有外部输入,对象智能体的自主行动、定时事件与时间推进仍会触发下一轮状态转移。
typed encoding→
(B)对象级到系统级推演多智能体未来模拟器
CANDIDATE SET · 𝒜ₜ识别潜在受影响对象people · objects · places
→
ENTITY DYNAMICS · fθ估计对象级状态转移Δxₜⁱ ∼ fθ(xₜⁱ, Sₜ, Uₜ)
→
SYSTEM READOUT · ρ聚合系统级结果分布crowd · traffic · risk · resources
→
INTERACTIONS · mθ建模交互与多阶传导person ↔ person ↔ object ↔ place
qθ(ΔXₜ, Gₜ₊₁ | Sₜ, Uₜ)条件于当前权威状态与本轮演化驱动,联合估计潜在受影响对象的状态转移及系统级结果分布
对象智能体世界引擎 · VALIDATOR gΩ规则、权限、不变量与历史一致性
↔
EVIDENCE LOOP · REPLAY / LOG / Dₕ确定性回放与实验日志 → 真人样本 / 真实结果校准 → 失败案例回归
ΔXₜ = candidate object-level transitionsGₜ₊₁ = emergent system outcome
two application modes↗↘
(C)持续世界运行【AI 原生游戏、具身智能】对象智能体世界引擎 ↔ 高负载仿真世界环境应用模式 1
{ΔX*, G*}候选状态变更
→
对象智能体世界引擎核验并提交 Sₜ₊₁
→
高负载仿真世界环境按状态变化包生成 oₜ₊₁
→
观察—状态对齐核对对象、空间与事件顺序
对齐结果返回对象智能体世界引擎 · PASS:发布观察并接收下一操作;FAIL:重新生成、修复状态或回滚版本
对象级变更记录 · ΔX*person / object: x → x′逐项记录谁变了,以及属性、关系或资源怎样变化
世界硬规则校验 · ΩID 唯一 · 权限 · 因果顺序违反规则的候选变化不得提交
版本化世界v1842 → tx#8F31 → v1843每次提交都可追踪、可修复、可回滚
(D)复杂情境模拟与决策推演【如城市治理、保险风险推演】对象智能体世界引擎 ↔ 高负载仿真世界环境 ↔ 多智能体未来模拟器应用模式 2
共同快照 SₜK 个隔离分支
→
施加方案 Uᵏ环境干预
→
世界环境生成观察 oᵢᵏ每个个体实际感知的环境
→
Human / Object Agents 响应选择、行动与相互影响
→
更新分支状态 Sᵏ↺ 多步循环
U¹ · 方案 A结果概率 P(G|U¹)
预期 · 不确定性
U² · 方案 B结果概率 P(G|U²)
预期 · 不确定性
Uᴷ · 方案 K结果概率 P(G|Uᴷ)
极端风险 · CVaR
世界环境提供观察,不直接给出宏观答案;每条分支循环多步后比较结果分布,柱形为概念示意
FIGURE READING(A) 对象智能体世界引擎维护权威状态;(B) 模拟器估计对象级转移及多阶传导;(C) 权威状态与世界环境持续对齐;(D) 各方案从共同快照独立运行。确定性回放、实验日志与真人结果共同构成校准和版本回归闭环。
S authoritative world state · U evolution driver · Δt time step · xⁱ object-agent state · G system outcomeAPPENDIX · A1
11 / 13ENTERTAINMENT PRODUCT · LIVE VALIDATION

AITown:即将上线的首个商业化产品

AITown 中人物、植物、地点、物品与城市事件组成的持续世界
人物、物品乃至环境实体,都成为持续存在的状态主体
AITown AI 角色互动界面
系统根据历史行为和当前情境组织下一次互动
持续城市世界
个人家园与创造
AITOWN 将进一步验证的 AI SOCIAL SIMULATION 能力
01 · SOCIAL STATE

主体、关系与世界状态

人物、关系、物品和环境共同更新,形成可回放的互动轨迹。

02 · ADAPTIVE EVENTS

可控情境与干预

按体验目标或研究问题生成随机等价情境,控制 AI 角色、任务与信息暴露。

03 · SOCIAL EMERGENCE

互动、传播与群体涌现

观察关系、信息、资源和规则如何把个体选择放大为群体结果。

04 · HUMAN CALIBRATION

真人结果校准

比较 Agent 预测与真人选择,把偏差写回训练、评测与概率校准。

AITown 的产品机制与在线验证能力仍属在研;Aivilization V0 与现有 Runtime 是已实现证据。面向工作室的许可与集成模式需以首个具名合作意向进一步验证。BAUHINIA AI · HONG KONG
08 / 13THREE COMMERCIAL PATHS · ONE SYSTEM

Commercialization

自营用户产品01 · DIRECT-TO-CONSUMER

自营 AI 原生互娱产品

PRODUCT & DATA FLYWHEEL

用产品同时获取数据与营收

Aivilization、AITown 与后续 AI 原生游戏持续承载真实互动、关系和个性化决策。

数据真实互动持续回流,扩大可定制决策数据集
营收内容消费、订阅、增值服务与 IP 商业化
MARKET VALIDATION · GAME DATA VALUE

拥有高价值数据的游戏公司

NIANTIC
US$3.5B游戏业务交易
GENERAL INTUITION
US$2.3B估值
游戏制作02 · B2B GAME INFRASTRUCTURE

面向游戏公司的 AI 角色服务

PRODUCTIZED ENGINE

把角色与社会世界能力嵌入游戏

提供身份、记忆、关系、行为、事件与社会状态 Runtime / SDK,以及项目级定制集成。

交付AI Character Engine · Runtime / SDK · Integration
收费技术许可 + 定制集成 + 运行量 / 长期服务
TARGET GAME DEVELOPERS · LATEST FULL-YEAR REVENUE

目标全球大型游戏公司客户 · 年营收

模拟用户反馈03 · B2B DECISION SUPPORT

面向大企业的辅助决策服务

SIMULATION-AS-A-SERVICE

投入前先模拟用户反馈与结果

围绕产品、定价、品牌、客户旅程与战略问题,交付方案排序、分群差异、不确定性和验证报告。

交付验证研究 → 定制化服务;长期稳定需求再开放专属 API
买方战略、产品、消费者洞察、品牌与定价团队
TARGET CUSTOMERS & CHANNEL PARTNERS
世界五百强企业
DATA–APPLICATION FLYWHEEL收集数据 → 进行预测与应用 → 更多客户提供更多数据 → 实现更好的预测与应用
市场案例:Niantic · US$3.5B 游戏业务交易 / Spatial AI 分拆 · General Intuition · US$2.3B 估值。最新完整财年收入:Tencent 2025 游戏 RMB241.6B · NetEase 2025 游戏 RMB92.1B · EA FY26 US$7.53B · Ubisoft FY26 €1.40B · CD PROJEKT 2025 PLN0.87B · Take-Two FY26 US$6.66B。前两家为游戏业务收入;后四家为公司营收。目标公司与渠道 Logo 不代表现有客户或合作关系。08 / 13
09 / 13R&D EXPANSION × INDUSTRY PARTNERSHIPS

当前部分客户:商业化开始落地

01
INTERACTIVE WORLDS

自研 AI 原生游戏 + 可规模化游戏技术服务

以 AITown 验证持续世界的留存与付费;同时把角色智能、长期状态和多智能体运行能力封装为 SDK / Runtime,服务游戏研发、内容运营与全球发行。

自研产品收入→SDK / Runtime→联运与长期服务
可规模化:一次研发形成跨项目复用能力,合作伙伴越多,数据、适配器与交付效率越强。
GAME PARTNERS · 2025 ANNUAL GAMING REVENUE
02
SIMULATION

用户决策模拟与情境推演

围绕一个明确决策,从共同快照比较多种方案;以领域数据、代表性真人样本和下游真实结果重新校准,先做盲测,再决定产品化。

验证研究→定制服务→长期需求专属 API
ENTERPRISE · CONSULTING · POLICY ACCESS
Company-confirmed financing: Angel + Pre-A > US$10M; formal application to attach cap table and closing evidence. Partner/resource logos indicate accessible networks unless explicitly labelled as existing shareholders.BAUHINIA AI · HONG KONG
10 / 13DECISION SUPPORT · SELECT USER CASES

部分客户案例

ONGOING CASE · 券商用户研究

中信证券

连续多年行业 #1营业收入与净利润1,700 万+个人客户
中信证券官方信e投 App 的真实界面和活动设计
信 e 投 · 官方产品界面
WHY TRADITIONAL RESEARCH BREAKS

金融偏好,不能靠少量问卷猜

人群差异极大:风险偏好、资产结构与使用习惯都不同。

不能大规模外测:未发布产品、UI 与广告若广泛招募,容易被市场提前知道。

OUR DECISION SUPPORT

辅助决策金融产品、APP UI 与广告方案

预计效果40–60%真人调研成本 ↓50–70%首轮筛选周期 ↓3–5×可比较方案数 ↑
奇瑞国际官网 TIGGO 9 官方产品图片
ONGOING CASE · 全球汽车用户研究

奇瑞全球化出海产品

134.4 万辆2025 出口 · 130+ 国家 / 地区
TIGGO 9 · OFFICIAL PRODUCT IMAGE
WHY TRADITIONAL RESEARCH BREAKS

逐国调研,既慢又贵

130+ 市场:语言、文化、法规与审美差异巨大。

逐国招募真人:样本难统一,周期与预算随国家数快速上升。

OUR DECISION SUPPORT

辅助决策外观设计与车机功能方案

预计效果50–70%跨国初筛成本 ↓60–80%首轮调研周期 ↓5–8×同预算市场覆盖 ↑
公开数据与产品图:中信证券 2025 年报(连续多年营业收入与净利润行业第一;1,700 万+个人客户) · Apple App Store(信 e 投官方界面) · 奇瑞集团 2025 销量公告(出口 134.4 万辆) · 奇瑞集团介绍(130+ 国家 / 地区) · CHERY International(TIGGO 9 官方图)。预计效果为内部估算,非已验证客户收益。10 / 13
12 / 13ROADMAP × REVENUE PLAN

关键节点与财务规划

技术底座验证2024–2026 Q2
产品数据闭环2026 Q3–2027 Q1
Simulation System 与跨域验证2027 Q2–Q4
付费试点与审慎扩展2027 Q3–2028+
Source: Bauhinia_7yr_Forecast_HKD_v11.xlsx · Revenue G15:Y24;产品线结构为规划口径,年度收入合计与现行预测一致。BAUHINIA AI · HONG KONG
13 / 13ACADEMIC × INDUSTRY × PRODUCT

从前沿研究到全球商业化的完整 AI 原生团队

两位教授顾问 × 腾讯战略投资与共同科研 × 33 人全职自研团队

杨浩巍

杨浩巍

FOUNDER & CEO
2023 – 至今 Bauhinia AI, Founder & CEO2024 – 至今 HKUST 数学博士生2022 – 2024 HKUST 数学硕士(MPhil)2017 – 2022 HKUST 数学与计算机 本科
徐培琰

徐培琰

CO-FOUNDER · EXECUTIVE PRODUCER
2025.08 – 至今 Bauhinia AI, Co-founder2021 – 2025 完美世界 游戏策划· 《诛仙 2》数值与商业策划· 《淡墨水云乡》主策划 / 项目负责人2017 – 2021 北京大学 经济学本科
王小龙

王小龙

CO-FOUNDER & CTO
2023 – 至今 Bauhinia AI, Co-founder & CTO2023 – 至今 HKUST 数学博士生2019 – 2023 中国科学技术大学 数学本科
陈子耕

陈子耕

CO-FOUNDER & COO
2023 – 至今 Bauhinia AI, Co-founder & COO2018 – 2023 腾讯 产品经理2014 – 2018 Rutgers 信息技术与商业分析本科
33
人全职团队BAUHINIA AI TEAM
17技术人员
6博士成员
12互娱人才
4产品人才
创造了 研发策划(策研一体) · Agent 策划 · 等 AI 原生新岗位— 这是 AI Native 团队独有的工种创新
陈卡你教授
ACADEMIC ADVISOR

陈卡你教授 · Kani Chen

HKUST 数学系与 IEDA 教授
随机建模、统计预测与机器学习研究。

高秉强教授
STRATEGIC ADVISOR × INVESTOR

高秉强教授 · Ping Keung Ko

HKUST 前工程学院院长
电子工程学者、科技产业创投家;Bauhinia AI 顾问及投资人。

STRATEGIC INVESTOR × JOINT RESEARCH PARTNER

腾讯 · 战略投资与共同科研

战略投资支持长期研发;双方持续推进 Multi-Agent Social Simulation 与智能世界方向的共同科研。

RESEARCH × ENGINEERING × PRODUCT × COMMERCIALISATIONBAUHINIA AI · HONG KONG
A2 / A8APPENDIX · RESEARCH PLATFORM

从公开部署到系统研究:我们已建成可分析的大型 Social Simulation 平台

Aivilization v0 研究论文稿首页
Aivilization v0 · 研究论文稿HKUST × Bauhinia AI;论文稿以公开部署的数据与受控消融实验为基础。
数万级智能体公开运行真实用户参与的持续在线人工社会。
600K+高频交易记录来自平台成熟运行阶段的连续日志。
400K记录进入论文分析使用成熟阶段连续区段,减少早期瞬态影响。
7×模拟时钟加速在持续运行中观察更长时间尺度的演化。
Aivilization v0 Planner 受控消融实验
CONTROLLED PLANNING ABLATION

不只提出架构,还验证哪些规划机制真正有用

在相同初始条件下比较完整 Branch-Thinking Planner 与简化版本:复杂、多目标、长周期任务更依赖完整规划机制;简单目标则可使用更轻量的 Planner。

Source: “Aivilization v0: Toward Large-Scale Artificial Social Simulation with a Unified Agent Architecture and Adaptive Agent Profiles” · current research manuscript.APPENDIX · A2
A3 / A8APPENDIX · EMPIRICAL RESULTS

600K+ 真实运行记录中,人工社会涌现出可统计检验的宏观规律

Aivilization 市场价格与成交量
市场动力学:论文从连续交易日志构建 5 分钟 OHLC 序列,分析收益分布与波动聚集。
Aivilization 教育、职业与财富分层
社会分层:教育投入、职业门槛与财富累积在同一运行世界中形成结构化差异。
HEAVY-TAILED RETURNS> 6.010 类代表资产均呈厚尾超额峰度最高为 9.873;明显偏离高斯分布。
VOLATILITY CLUSTERINGp < 10⁻⁶波动聚集通过统计检验Ljung–Box 检验显示绝对收益存在显著时间依赖。
STRUCTURED STRATIFICATION非线性教育—财富梯度与职业分层论文观察到财富随教育程度上升的非线性趋势,以及职业层级差异。
Source: Aivilization v0 manuscript, Sections 4–5. These results show measurable emergence inside the simulated society; they are observational and do not by themselves establish causal policy forecasts.APPENDIX · A3
A4 / A8APPENDIX · PRODUCT VALIDATION

Aivilization 公开测试验证:用户需求与运行经济性同时成立

Aivilization 持续运行的人工社会世界
FIRST-PARTY PRODUCT EVIDENCE

一个真实用户可以进入、观察并影响的持续人工社会

不是封闭实验室中的单次演示,而是经过公开部署、用户传播与长期运行检验的产品系统。

5万+
两个月公开测试参与人数零付费获客;增长主要来自自然传播与媒体扩散。
2 hrs核心玩家平均单次时长用户不仅进入世界,也愿意持续观察与参与其中的变化。
HONG KONG SERVER · RETENTION

没有签到与付费系统,仍形成长期回访

44.3%次日留存Day 1
26.3%七日留存Day 7
13.2%三十日留存Day 30

全服务器口径为 38.1% / 20.8% / 9.5%。香港服务器数据用于呈现核心早期用户群的长期参与度。

OPERATING ECONOMICS

大规模运行成本已可控

US$2单智能体月均推理成本在持续在线、多人并发的真实产品环境中测得。
> 1自然传播系数公开测试阶段形成自传播,而非依赖买量。
Source: Bauhinia AI first-party product analytics, reproduced from the company’s Pre-A deck. Public web release; no paid acquisition, retention mechanics or payment system during the reported period.APPENDIX · A4
A5 / A8APPENDIX · JOINT RESEARCH · STAGE I

腾讯共同科研阶段成果:从“能运行”走向可重复、可量化评测

Bauhinia 与 Odyssey 在共享任务上的成功率比较
VALID SUCCESS · SHARED TASKS98% vs 84%

同一批共享任务,完整成功率更高

4 个智能体、5 个可公平比较任务、每项 10 次运行:自研系统 49 / 50 次有效成功,对照为 42 / 50。

Bauhinia 与 Odyssey 的动作失败率比较
ACTION RELIABILITY2.4–13.3%

底层动作失败率显著降低

在相同任务组中,对照框架为 38.1–62.8%;意味着任务完成不再依赖大量失败重试。

Source: “MCsociety 阶段技术报告 · 2026-06”. Internal joint-research report. Success and failure metrics are execution logs; soft-quality scores are LLM-judged diagnostics, not deterministic ground truth.APPENDIX · A5
A6 / A8APPENDIX · JOINT RESEARCH · STAGE II

同任务跨框架实测:更少协调开销,带来更快、更稳定的多智能体执行

Bauhinia 与 Odyssey 多智能体任务端到端耗时比较
测试矩阵:5 个智能体、两类世界、工具 / 防具两类钻石任务、三种 Qwen3.5-27B 变体;两侧采用相同动作抽象。各条件样本量不同,结果来自内部阶段技术报告。
1.81×整体等权平均速度1,561.5 s → 865.0 s;耗时下降 44.6%。
5.45×单项最大速度差除一个条件外,其余测试条件均更快。
1–10%动作失败率对照框架为 61–78%。
4.9–12.4%重复运行波动 CV对照框架高方差组为 49.1–93.7%。
两种多智能体架构的 LLM 调用与 token 对比
每次运行:自研架构 8.5–44 次调用 / 25K–157K tokens;对照框架 456–1,388 次 / 690K–2.18M tokens。
Source: “MCsociety 阶段技术报告 · 2026-07 draft”. Internal full-system benchmark, not an independent third-party audit; sample sizes and seeds vary by condition.APPENDIX · A6
A7 / A8APPENDIX · ENGINEERING VALIDATION

Social Simulation 核心不只跑一个世界:已验证声明式迁移与可审计改进

声明式世界生成与运行链路
PORTABILITY · DECLARATIVE WORLD SPEC

换规则与任务,不重写核心引擎

通过 world.json、工作流声明和提示词包定义地点、配方、订单与角色;核心引擎保持稳定,复杂度从单链提升到双链与多输入配方 DAG。

6 / 6基线订单履约并正式收尾
1st run双链与配方 DAG 首次实测即完整通过
多智能体运行审查报告与证据链
HUMAN FEEDBACK · AUDITABLE IMPROVEMENT

从一句人工反馈,追到证据、修复与回归测试

ReviewAgent 只读检索日志、源码与机器指标;优化提案在一次性沙盒中试应用,生成 diff 与测试结论,最终仍由人工决定是否采纳。

14 steps一次真实审查的证据探索
4 findings带证据引用与根因假设
179 / 179人工采纳前测试全绿
Source: “MCsociety 阶段技术报告 · 2026-07 draft”. Recorded validation includes deterministic replay tapes, browser replay, evidence-linked findings and human acceptance gates.APPENDIX · A7
A8 / A8APPENDIX · COMPETITIVE LANDSCAPE

把世界做活 = 世界智能 × 感官品质;Aivilization 正切入右上无人区

以世界智能和感官品质为坐标,对比 3A 游戏、AI 原生产品与 Aivilization 的竞争定位矩阵
3A / HIGH-SENSORY PRODUCTS

感官强,但 Agent 与涌现多为传统或单点

GTA 6、黑神话、inZOI、星布谷地与逆水寒代表画面和沉浸上限,世界底层仍主要依赖传统系统。

AI TEXT / COMPANION PRODUCTS

智能强,但多停在文字、实验或单 Agent

Pax Historia、AI Dungeon、Project Sid、Character.ai 与 Simile 已验证智能交互,但感官和持续世界仍有限。

AIVILIZATION · OUR POSITION

多 Agent 涌现 × 持续世界 × 产品化感官

从已经上线的 2D 可玩产品出发,同时提升世界智能和感官品质,向右上交叉区域持续迭代。

Source: Bauhinia AI Pre-A deck · Slide 12 · Competitive Landscape. The matrix is an internal strategic comparison based on public product characteristics, not independent third-party scoring.APPENDIX · A8
← → / SPACE · WHEEL