GPT-6 Astra参与完整游戏开发,Browser Use转向按量付费

2 阅读

GPT-6 Astra 协助完成完整游戏开发

一位开发者分享了使用 GPT-6 Astra 制作类“吸血鬼幸存者”游戏的全过程。整个项目并非仅停留在概念或原型阶段,而是真正产出可玩内容:包括大型地图、铁匠铺交互系统以及完整的 BOSS 战设计。GPT-6 Astra 在这个过程中直接操作 Blender 和 Godot 引擎,生成美术资源、编写脚本并调整关卡逻辑。

大黑

值得注意的是,这并非简单的代码生成。开发者需要不断与模型沟通需求、修正偏差,并在关键节点介入调整。例如,在构建地图时,模型最初生成的地形过于重复,经过几轮反馈后才加入更多变化元素。最终成品虽然仍有粗糙之处,但已具备完整的游戏循环和可玩性。试玩链接已公开,供社区测试反馈。

这种“人机协作开发”模式正在成为独立游戏的新路径。相比传统流程,它大幅降低了美术和编程门槛,让单人开发者能更快验证创意。不过,模型对游戏设计原则的理解仍有限,容易陷入表面功能堆砌而忽略节奏与体验平衡。开发者表示,后续会继续优化核心玩法,而非单纯增加内容量。

Browser Use 取消订阅制,全面转向按量付费

Browser Use 宣布调整其商业模式:取消原有的固定月度订阅,改为完全按实际使用量计费。新用户注册即可获得 15 美元免费额度,用于尝试其自动化浏览服务。这一变化显著降低了开发者的试用门槛,尤其对偶尔使用或处于早期验证阶段的项目更为友好。

此前,Browser Use 的订阅套餐对轻度用户来说存在浪费,而重度用户又常面临超额费用。按量付费模式理论上更公平,但实际成本取决于具体使用场景。例如,频繁执行复杂页面交互的任务可能累积较快费用,而简单数据抓取则成本极低。官方未公布详细计价标准,仅表示将基于“操作步骤数”和“资源消耗”综合计算。

社区对此反应不一。部分开发者欢迎灵活性提升,认为这有助于探索更多自动化用例;另一些人则担忧长期使用成本不可控,尤其当任务规模扩大时。目前,已有用户开始测试不同场景下的费用表现,并分享优化技巧以减少不必要的操作步骤。

本地模型社区的新实践

K2-Horizon 系列模型发布

IFM 被传发布了 K2-Horizon 系列开放模型,包括 7B 和 32B 的稠密版本,以及两款 MoE(Mixture of Experts)架构模型。不过,Reddit 上的讨论指出,目前放出的可能仅为训练初期的检查点,模型能力尚未完全收敛,且许可证条款也未明确。这意味着社区虽可下载测试,但商用或大规模部署仍需谨慎。

有用户尝试在本地运行 7B 版本,初步反馈显示其推理速度尚可,但对复杂指令的理解不如主流开源模型稳定。由于缺乏官方文档和基准测试,这些模型的真实性能仍待验证。社区呼吁 IFM 尽快公布训练细节和评估结果,否则很难判断其是否值得投入精力适配。

Qwen 量化技术取得进展

在模型压缩方面,有开发者声称通过“任务感知量化”方法,将 Qwen3.8 27B 模型体积压缩至 BF16 格式的 15%,同时保持 82.81% 的推理得分(BF16 原版为 83.59%)。这一结果若属实,将极大降低大模型的部署门槛。

不过,该成果尚未被广泛复现。多位社区成员表示尝试相同方法后效果不佳,怀疑原作者可能针对特定任务进行了过度优化。量化本身是一把双刃剑——过度压缩会导致知识丢失,尤其在开放域问答中表现明显。目前,主流方案仍倾向于在精度和体积间寻找平衡点,而非追求极致压缩。

超轻量模型跑在 CPU 上

更有意思的是,一位用户成功在纯 CPU 环境运行 Qwen3.5 0.8B 模型,用于清理本地听写生成的文本。他借助 Codex 编写了一个小型 C++ 推理引擎,绕过了对 GPU 的依赖。虽然处理速度较慢(每秒约 2-3 个词),但对于离线、低频的文本后处理任务已足够。

这种“CPU+超小模型”的组合开辟了新场景:比如在无网络环境下的语音转写校对,或嵌入式设备上的简单语义理解。尽管能力有限,但胜在部署简单、隐私可控。开发者表示,下一步计划优化引擎效率,并尝试集成更多轻量模型。

游戏与工具中的 AI 应用

Warrior Quest:用本地模型驱动 NPC

暗黑风格 RPG《Warrior Quest》采用了一种折中方案:仅让本地大模型负责 NPC 对话生成,而将任务逻辑、世界状态和剧情分支保留在确定性系统中。这样既利用了 LLM 的语言创造力,又避免了因幻觉导致的任务断裂或状态混乱。

具体实现上,游戏引擎会向模型提供当前上下文(如玩家位置、已完成任务、NPC 关系等),模型据此生成符合角色设定的回应。所有关键决策(如任务完成条件、物品获取)仍由预设脚本控制。测试显示,NPC 对话自然度显著提升,且未出现破坏游戏进程的错误。

开发者强调,这种“有限 AI”策略比全盘依赖模型更可靠。未来计划扩展至更多互动场景,但核心机制仍将保持确定性。这也反映了当前游戏 AI 的务实趋势:不追求全能,而是在特定环节增强体验。

Claude Code 辅助开发视频压缩器

Simon Willison 分享了使用 Claude Code 开发浏览器端视频压缩工具的经历。该工具基于 WASM FFmpeg,允许用户直接在网页上传视频并压缩,无需服务器中转。Claude Code 主要协助编写了 WASM 绑定代码、前端交互逻辑以及错误处理机制。

整个过程并非一键生成。Simon 需要反复调整提示词,明确性能要求和兼容性约束。例如,初始版本在移动端崩溃,经多次迭代后才优化内存使用。最终成品虽功能简单,但证明了 AI 在 WebAssembly 这类复杂技术栈中的辅助价值。

有趣的是,Simon 特意提到,Claude 对 FFmpeg 参数的理解优于其他模型,能准确推荐适合 Web 环境的编码选项。这或许说明,特定领域的微调模型在专业任务中更具优势。

ChatGPT 新增写作风格学习功能

OpenAI 为 ChatGPT 添加了从用户文档中学习写作风格的能力。用户可连接 Gmail、Google Docs 或 Notion 等工具,让模型分析历史文本,从而在生成内容时模仿个人表达习惯。例如,经常使用短句和列表的用户,会得到更简洁的回复;偏好正式语气的用户,则会收到结构严谨的文本。

然而,中文用户反馈该功能“适配有限”。部分人发现模型对中文语境下的风格差异(如口语化程度、敬语使用)捕捉不够精准,有时甚至混淆不同文档的风格。此外,隐私顾虑也存在——尽管 OpenAI 声称数据仅用于本次会话,但用户仍担心敏感内容被间接利用。

目前,该功能默认关闭,需手动启用。OpenAI 表示将持续优化多语言支持,但未给出具体时间表。对于高度依赖写作风格一致性的用户(如品牌文案、学术写作),现阶段可能仍需人工校对。

实际落地比概念更重要

纵观本期动态,一个明显趋势是:AI 应用正从“炫技”转向“解决具体问题”。无论是用 GPT-6 Astra 做完整游戏,还是在 CPU 上跑 0.8B 模型清理文本,开发者关注的不再是模型有多强,而是能否在现有约束下交付可用结果。

Browser Use 的计费调整也反映了这一务实态度——降低试错成本,让更多人能快速验证想法。同样,Warrior Quest 的设计哲学表明,AI 不必包办一切,只需在合适环节发挥作用即可。

当然,挑战依然存在。量化模型的稳定性、本地部署的易用性、多语言支持的深度,都是阻碍大规模落地的瓶颈。但比起空谈“革命”,这些细碎的工程实践或许更能推动 AI 真正融入日常工具链。