跳转到正文

AI 模型与游戏

Jev 能让 AI 游戏主持人更快吗?一种游戏设计方案

TypeSafe Jev 能否加速 AI 游戏主持人?了解结构化决策、混合 RPG 工作流,以及更快的模型调用对整体游戏延迟的影响。

作者 Playworlds · Elser.AI ·

金色路线在游戏主持人的展开地图上汇聚,通向发光的城门,周围摆着冒险者模型和骰子。

Jev 可以处理拖慢回合的小型决策,从而有望加快 AI 游戏主持人的响应:理解尝试的行动、选择工作流,或评估 NPC 可能的反应。机会在于缩短故事继续之前的处理过程。改善幅度取决于这些决策目前占据玩家等待时间的比例。

TypeSafe 于 2026 年 9 月 15 日推出 Jev 的抢先体验版。发布说明将其描述为用于有类型决策、而非自由文本生成的 System One 模型,报告称适用查询的响应为 70–500 毫秒,速度提升 40–200 倍。这些是供应商报告的数据,并非 Playworlds 的测试结果。 TypeSafe 的 Jev 发布公告.

对 AI RPG 而言,这启发了一种搭配:快速决策模型帮助游戏决定接下来发生什么,语言模型则把已结算的结果写成场景。以下是我们提出的游戏设计,并非已实现的 Jev 集成。

想走进一场 AI 冒险吗? 体验 Playworlds:找到喜欢的设定,决定你的角色首先做什么。

为什么 AI 主持人有时要等很久

玩家写道:“同伴引开守卫时,我悄悄溜过去。”这只有一句话,但游戏在描述结果前可能需要回答多个问题。

玩家在对谁说话?正在尝试潜行、交谈还是战斗?同伴能参与吗?目标地点能到达吗?行动需要掷骰吗?哪些信息应进入下一次叙事提示?

某些答案已经存在于游戏状态中,另一些需要理解。如果应用按顺序分别调用通用语言模型来回答每个问题,玩家看到第一个有用的字之前,等待就可能层层累积。

先检查这条处理链。删除多余调用,或直接查询已知事实,可能比更换模型更有价值。只有确实存在需要理解的决策时,快速模型才最有用。

什么是 System One 模型?

TypeSafe 文档介绍了三类问题:Choice 选择一个选项,Score 根据评分标准进行评估,Noul 则针对一个陈述返回零到一之间的值。多个问题可以共用一次调用,但会根据提供的状态独立评估。Choice 和 Score 还返回置信度。 TypeSafe 文档.

这一接口启发了不同的 AI 主持人设计方式:不要先要求一个不受限的计划,再去解析大段文字,而是直接定义游戏真正能使用的决策,并由外围代码负责组合它们。

例如,行动分类器可以在以下标签中选择: sneak, talk, attack, inspect,以及 other。另一个问题可以评估措辞是否要求同伴帮忙。这些标签只是应用设计示例,并非 TypeSafe API 语法。

Jev 可以放在 RPG 回合的哪些环节

游戏任务

建议方法

原因

理解自由文本行动

用少量支持的意图类别评估 Jev

输出可以选择预先定义的工作流。

评估 NPC 的回应类别

测试怀疑、合作或回避等选项

叙事模型可以按照角色特点表达选定反应。

检查物品栏或剩余移动量

读取权威游戏状态

已保存的事实不需要概率性的回答。

结算骰子并应用伤害

执行游戏规则

规则结果应该可复现、可审查。

理清复杂任务选择

必要时使用更深入的推理步骤

可能需要综合考虑多项相互依赖的事实。

编写场景和对话

使用 Luna 或 Sol 等语言模型

玩家需要易读、富有表现力的叙事。

这些是待测试的方向,并不是说 Jev 已在 Playworlds 中证明了每项能力。

守卫遭遇场景的更快流程

首先,载入一份精简的当前状态快照:守卫位置、玩家位置、同伴能否参与,以及相关规则。排除决策不需要的事实。

接着,合并提出彼此独立的理解问题。行动的表面意图、是否要求引开注意力,都可根据原始消息评估。依赖掷骰结果的决策必须等待掷骰完成;把有依赖的问题放入同一批次,并不能消除依赖。

然后,让引擎检查前置条件并结算尝试。同伴不在场时,游戏不应悄悄编造其参与。行动不明确时,可以简短询问玩家,或交给更强的理解模型处理。

最后,将已确认的结果交给叙事模型。例如:干扰成功,玩家到达拱门,守卫注意到掉落的搭扣,却认不出主人。叙事模型可以生动呈现这一刻,而不在段落中途改变结果。

玩家体验到的是连续的场景。内部每个环节各司其职,引擎只提交一次最终状态。

你的方法也许是虚张声势、讨价还价,或仔细观察周围。 在 Playworlds 选择下一场冒险 ,把这个意图带入场景。

决策快 100 倍,游戏也会快 100 倍吗?

不会。设想一个示例回合:三个依次进行的理解调用,每个耗时两秒,之后再进行四秒的叙事生成:

3 × 2 秒 + 4 秒 = 10 秒

现在假设每次理解调用只需 0.1 秒:

3 × 0.1 秒 + 4 秒 = 4.3 秒

决策调用快了 20 倍,但整个回合只快了约 2.3 倍,等待时间减少 57%。如果三个决策彼此独立,并可在 0.1 秒内批量完成,示例总时间将变为 4.1 秒。

这些数字是为解释计算而设定的,并非 Jev 或 Playworlds 的实测数据。示例假定各阶段顺序执行,并省略了检索、验证、网络开销和语音生成。

这里仍有很大的改善空间。把长暂停缩短几秒,就可能改变调查或对话的节奏。但一旦叙事成为最慢环节,继续加快决策对总耗时的影响便会减小。应测量从提交行动到收到可用结果的完整链路。

类型安全,不代表剧情判断正确

TypeSafe 的发布说明区分了“保证符合结构定义”与更广泛的性能声明。它也指出,标题中提到的工作流提升可能接近实际改善的上限,且公开速度评估通常在美国西海岸进行。 TypeSafe 基准测试的适用说明.

回应可以符合要求的类型,却仍作出错误决策。当玩家本想虚张声势时,选择 attack 就是一个格式合法、后果却不合意的标签。同样,如果输入遗漏了相关事实,看似合理的 NPC 反应也可能违背早先的承诺。

把不确定性作为游戏流程的一部分。用有代表性的行动测试置信度阈值,保留 other 分支,并让模糊情况能够补救。只有帮助应用判断何时执行、何时索取更多信息时,置信度才有价值。

如何证明主持人确实提速了

有用的测试集应包含普通对话、模糊行动、战斗尝试、复合请求,以及依赖早先线索的场景。让现有流程与新方案处理相同的已保存状态。

同时测量速度和错误的后果:

  • 首个有用回应: 玩家收到可以据此行动的信息的时间,而非仅仅看到加载提示。
  • 完整回合耗时: 叙事与已确认的状态变更全部就绪的时间。
  • 中位数与 p95 延迟: 典型等待时间,以及会打断冒险节奏的较慢回合。
  • 决策准确率与回退率: 正确识别行动意图的频率,以及需要额外处理步骤的频率。
  • 状态一致性: 回合结束后,物品、位置、资源与任务事实是否一致。
  • 每个完成回合的成本: 包括所有调用、重试和回退处理。

最初的实验可以让 Jev 与当前理解模块并行评估,但不允许它更改线上游戏状态。先比较分歧,再决定哪些范围明确的决策适合安全、有效地进入实际流程。

这可能为 Playworlds 带来什么

目标是一场跟得上好奇心的冒险:再问一个问题,再检查一条线索,再尝试一种方法。Jev 是减少其中理解环节延迟的候选方案。完整游戏仍需要可靠规则、持久状态和令人满意的叙事。

本文描述一种可能的架构,并非宣布 Playworlds 已使用 Jev。想体验现有冒险形式,可以 在 Playworlds 选择一个世界。如果想更好地表达角色意图,可阅读我们的 角色扮演行动写作指南.

常见问题

Jev 能取代整个 AI 地下城主持人吗?

更适合把它用于主持人流程中的特定决策。在本文方案中,独立叙事模型编写场景,游戏引擎负责规则和已保存状态。

在 RPG 中,Jev 比 GPT-6 Luna 或 Sol 更快吗?

我们尚未进行 RPG 对比。有效测试应保持决策、上下文、区域和输出要求一致,并测量完整回合,而不只是某一次供应商调用。

Jev 能与 GPT 模型协作吗?

可以。应用可以组合决策服务与文本生成服务。关键在于传递经过验证的结果,让叙事与实际保存的状态一致。

主持人的每次检查都应使用 AI 吗?

不应如此。已知规则和存储事实应用确定性代码处理。只有普通逻辑无法充分处理的理解任务,才交给模型。

为下一场冒险迈出第一步

选一个世界,面对眼前局面,决定你的角色如何回应。 开始体验 Playworlds →