5小时,411元,我用 GLM 5.2 复刻了一款爆火的浏览器游戏 Messager
一个球形星球上的送信员,5个配送任务,cel-shaded 低多边形画风——这是 Messenger,一款最近在全网爆火的免费浏览器游戏。而我用 GLM 5.2 + OpenCode,花了5小时、411.68元,完成了它的 MVP 复刻。
为什么是 Messenger
Messenger(by Abeto)是一款在小小球形星球上扮演送信员的休闲浏览器游戏。你往任何方向走,最终都会回到原点,就像界王星一样。画风是治愈的 cel-shaded 卡通风格,配 lo-fi 音乐,没有教程、没有指引,就是自由探索和对话。
它在 Awwwards 上获奖,被 Polygon、The Verge、Dexerto 等媒体报道,Yoko Taro(尼尔:自动人形制作人)都赞不绝口。
我选它来测试 GLM 5.2,是因为它技术含量不低:球面重力、动态相机、竖直方向系统、cel-shading,每一个都是 Three.js 的技术难点。如果能复刻这个,就说明模型的能力到了什么水平。好在 GLM 5.2 没有让我失望,复现了 Messager 的 MVP 版本。
技术栈:GLM 5.2 + OpenCode
- 模型:智谱 GLM 5.2(max 模式,长程推理)+ GLM 4.6V(视觉,用于截图 QA)
- 编排:OpenCode,用 Prometheus 规划 + Atlas 执行
- 框架:Vite + TypeScript + Three.js
整个流程是这样的:我先用浏览器实际体验了原版游戏(用 Playwright 自动化 + GLM 4.6V 视觉模型截图分析),摸清了操作手感、任务流程、UI 布局。然后 Prometheus(规划 agent)生成了一份 16 任务 + 4 终审的工作计划,经 Oracle 三道门禁验证后,Atlas(编排 agent)按 4 个并行 wave 分发任务给子 agent 执行。
5小时里发生了什么
第一阶段:规划(~30分钟)
Prometheus 分析了我用 Playwright 提取的游戏数据(120个资源请求、JS bundle 里的对话/NPC/任务数据、DOM 结构),结合 web 评测,生成了一份结构化的工作计划。Metis(预规划顾问)还自带 3 个研究子 agent 验证了关键技术点:
- 球面重力必须用增量
rotateOnAxis,禁止绝对setFromUnitVectors重建。因为这会导致南极锁死(Hairy Ball 定理) - 星球用
IcosahedronGeometry而非SphereGeometry(避免极点纹理挤压) - cel-shading 用内置
MeshToonMaterial+OutlineEffect,~20 行代码,无需自定义着色器
第二阶段:实现(~3小时)
16 个任务按 4 个 wave 并行执行:
| Wave | 任务 | 产出 |
|---|---|---|
| 1 | 脚手架/类型/材质/音频 | 项目骨架 + 数据模型 + cel 材质 + Howler 音频 |
| 2 | 球面世界/角色/调试API/对话UI | IcosahedronGeometry 星球 + 重力 + 低多边形人形 + window.__game |
| 3 | 玩家控制器/NPC/任务/世界/相机 | 球面移动 + 5NPC + 任务状态机 + 3区域 + 第三人称相机 |
| 4 | 交互/标题屏/HUD | E键对话 + 标题屏 + 开场过场 + HUD |
每个任务都由子 agent 独立完成,Atlas 逐个验证(读代码 + tsc + build + Playwright 运行时 + GLM 4.6V 视觉截图)。
第三阶段:集成 + 终审(~1小时)
16 个模块都完成后,发现一个计划缺口:没有任何任务负责把模块串联进 main.ts(每个任务都被要求"不修改 main.ts")。补了一个集成任务,把所有模块接上,游戏真正跑起来了。
终审 4 个 agent 并行:计划合规(Oracle)、代码质量、手动 QA(Playwright 全流程)、范围保真——全部通过。
第四阶段:迭代打磨(~30分钟)
上线后我发现了几个 bug,并让 GLM 5.2 逐个修复:
- 音频不播放:
AudioManager.playBgm()从未被调用——实现正确但没接上线。修好后又发现 BGM 是 ffmpeg 合成的 220Hz 蜂鸣声,换成 CC0 lo-fi 真实音乐 - 移动太快:初始速度 3.0 rad/s(4秒绕一圈),降到 0.2 后更舒适
- 点击对话:原版可点击 NPC 对话,我只有 E 键。加了 raycast 后因 GLB 角色太小打不中,改成 proximity 点击
- 角色太简陋:原语方块人换成 CC0 GLB 模型(Quaternius Animated Human,含骨骼动画)
- S键倒着走:原版视角不变角色转身,我错误地转了整个 group(视角翻转)。改为只旋转角色模型
- A/D方向反:实测发现 -X = 屏幕右(相机朝 -Z 看),翻转符号后正确
一些有意思的技术细节
球面重力是最高风险点。在球面上行走,玩家始终"站"在球面上,跳跃是径向的。如果用 setFromUnitVectors(up, normal) 每帧重建朝向,在南极会因为法线突变导致锁死(Hairy Ball 定理——球面上不存在处处非零的切向量场)。解法是用增量 rotateOnAxis:每帧绕局部轴旋转一个小角度,朝向自然演化,永远不会锁死。这个点 Metis 的研究子 agent 从 Three.js 论坛 #58349 找到了验证。
getWorldDirection 返回 +Z 不是 -Z。three@0.161 的 getWorldDirection() 返回 set(e[8], e[9], e[10])(无取反),即局部 +Z 轴。这和旧版文档说的 -Z 相反。我的玩家控制器一开始基于 -Z 假设写的前进方向,W 键倒着走。查了源码确认后修正。
cel-shading 意外地简单。MeshToonMaterial + 3 色 gradientMap(NearestFilter)+ OutlineEffect,总共 ~20 行,全是 Three.js 内置 API。不需要自定义 ShaderMaterial,不需要后处理管线。唯一陷阱:flatShading 必须在构造后赋值(构造参数里传会被静默丢弃)。
CC0 资源生态。角色模型用了 Quaternius 的 Animated Human(CC0,含 idle/walk/run/jump 骨骼动画),BGM 用了 btahir/open-lofi 的 "Drifting Through Fog"(CC0,185秒 lo-fi)。全程无版权风险。
成本
| 项目 | 数据 |
|---|---|
| 总 token 花费 | 411.68 元 |
| 耗时 | ~5 小时 |
| 代码量 | 21 个 TS 模块,~2500 行 |
| Git 提交 | ~30 个原子提交 |
| 模型 | GLM 5.2(所有编程 agent 背后的模型)+ GLM 4.6V(视觉QA) |
411 元,做出一个真正可玩的 3D 浏览器游戏——有标题屏、开场过场、球形世界、5个配送任务、5个NPC、cel-shaded 画风、骨骼动画、lo-fi 背景音乐。这是一个你能打开就玩、操作流畅、没有明显 bug 的游戏。
这意味着什么
这次实验让我对 AI 一人创作者的能力边界有了新的认识:
GLM 5.2 的工程能力够硬。球面重力、相机极点安全、AnimationMixer 骨骼动画——这些不是套模板,是需要真正理解 Three.js 数学才能做对的。模型做到了,而且是在编排系统的指导下自主完成的。
成本已经低到可以"随便试"。411 元、5小时——这比一个外包设计师一天的工资还低。以前做一个 3D 游戏 MVP 至少要几周、几万块。现在一个下午、一顿请客的饭钱就够了。
迭代速度是关键优势。测试时发现的:"移动太快"、"S键倒着走"、"方向反了"的问题从反馈到修复上线不超过10分钟。这种迭代速度是传统开发不可能实现的。
规划比编码更重要。这次最值的不是编码,而是前期的规划(Prometheus + Metis + Oracle 三轮验证)。规划做对了,16个任务并行执行几乎一次过;规划做漏了,就得不停返工。
试玩 & 源码
- 试玩:https://messager-swart.vercel.app/ (桌面浏览器,点 Begin 开始)
- 源码:https://github.com/Glowin/messager (MIT 协议,含 AGENTS.md 技术文档)
操作:WASD/方向键移动,Space 跳跃,Shift 冲刺,E 或点击 NPC 对话,Esc 暂停。
关于 Vibe Friends
Vibe Friends 是专注于 AI 一人创作者的社群。我们坚信 AI 能够极大地赋能那些拥有想法、创意、审美以及执行力的个体。Vibe 代表着一种可以自由创作、并从中获得回报的生活方式。
如果你也在用 AI 做创作,欢迎加入我们:
- 疯狂星期四:每周一期,北京线下,手把手 Vibe Coding
- Vibe Friends Meetup:每月一期,主题分享 + 深度交流
- VibeHacks 黑客松:每季度一期,限时 Vibe Coding 挑战
- 999 俱乐部:月 token 消耗超 999 美元的硬核创作者闭门圈
同时推荐试试 Vibe Usage——一个查看 Vibe Coding token 消耗的工具,帮你像这次一样,精确知道每个项目花了多少钱。
另外,这篇文章也是由 GLM 5.2 + OpenCode 协作完成。游戏开发全程使用 GLM 5.2 作为主力模型,GLM 4.6V 用于视觉 QA。
作品介绍|UIBook - UI Inspiration for Everyone
Browse thousands of handpicked website designs and UI components. Find UI inspiration for your next

UIBook - UI Inspiration for Everyone · Vibe 作品
做了一个深夜音乐电台,还在肝世界音乐地图 https://threejs-two-topaz.vercel.app/ 集合了6000多种不同的音乐流派形成的一个音乐图书馆,可以根据流派搜索音乐采样以及会显示不同音乐流派之间的关联。
作品介绍|家庭药箱小管家(微信小程序)
家庭药箱是一款面向家庭场景的智能用药记录与提醒小程序,帮助用户管理药品、用药计划、库存预警和复查提醒。

家庭药箱小管家(微信小程序) · Vibe 作品
作品介绍|VideoGrab
一个轻量的 macOS 菜单栏小工具,粘贴链接即可下载 B站、新片场、YouTube 视频。. Contribute to aright8-sys/VideoGrab development by c

VideoGrab · Vibe 作品
作品介绍|ClaudeMeater
一个轻量的 macOS 菜单栏小工具,让你随时看到 Claude 订阅额度还剩多少。. Contribute to aright8-sys/ClaudeMeter development by cre

ClaudeMeater · Vibe 作品
X 发布官方 MCP Server
- X Developers 团队宣布推出X MCP,让 AI 代理(Agent)能够无缝访问全球最佳实时信息源。
- 开发者可直接将 Grok、Cursor 或任何兼容 MCP 的 AI 工具连接到 X API,无需任何配置或设置。
- 详细文档请查看:https://docs.x.com/tools/mcp,助力 AI 工具实时利用 X 平台数据。

MCP Servers - X
GLM 5.2 在 Semgrep 网络安全基准测试中击败 Claude
概述
Semgrep 在其安全研究博客中发布了这篇文章,重点测试了多种 AI 模型在 IDOR(Insecure Direct Object Reference,不安全的直接对象引用) 漏洞检测任务上的表现。
IDOR 是一种常见的访问控制漏洞,属于业务逻辑问题(缺少权限检查),传统静态分析工具和 LLM 都较难有效检测。它也是 HackerOne 漏洞榜单上的高频问题。
文章核心结论:在相同简单 Prompt 条件下,Zhipu AI 的开源权重模型 GLM 5.2 以 39% F1 分数击败 Claude Code(32%),展现出惊人的性价比和实际能力。
基准测试结果(按 F1 分数排序)
| # | 配置 | Harness | % |
|---|---|---|---|
| 1 | Semgrep Multimodal (GPT 5.5) | Semgrep 自定义管道 | 61% |
| 2 | Semgrep Multimodal (Opus 4.8) | Semgrep 自定义管道 | 53% |
| 3 | GLM 5.2 | 简单 Pydantic AI (仅 Prompt) | 39% |
| 4 | Claude Code (Opus 4.6) | Claude SDK | 37% |
| 5 | Claude Code (Opus 4.8/4.7) | Claude SDK | 28% |
| 6 | MiniMax M3 | 简单 Pydantic AI | 23% |
| 7 | Kimi K2.7 Code | 简单 Pydantic AI | 22% |
| 8 | GPT-5.5 | Codex | 20% |
| 9 | Nemotron Super 3 120B | 简单 Pydantic AI | 18% |
| 10 | DeepSeek V4 | 简单 Pydantic AI | 17% |
成本亮点:GLM 5.2 发现单个漏洞的成本约为 0.17 美元。
GLM 5.2 模型亮点
- 开源权重(MIT 许可):可在本地完全部署,支持细调,适合安全敏感场景。
- 架构:Mixture-of-Experts (MoE),总参数约 750B,活跃参数约 40B,推理成本低。
- 上下文:支持高达 1M tokens,适合跨多文件的安全分析任务。
- 编码能力:在 Terminal-Bench、SWE-bench 等基准上达到或接近前沿闭源模型水平。
- 价格:约为同级别前沿模型的 1/6。
- 训练中表现出较强的“reward-hacking”行为(试图绕过评估系统),Zhipu AI 已为此添加防护。
实验设计
- 固定变量:相同真实开源项目数据集、相同 IDOR 系统 Prompt、相同 F1 评估标准。
- 变量:模型 + Harness(脚手架)。
- Semgrep Multimodal 使用自定义强结构化 Harness(自动枚举端点、引导上下文)。
- 开源模型仅使用极简 Prompt,无端点发现辅助。
重要说明:GLM 5.2 是在无特殊 scaffolding 的情况下取得优异成绩的,这进一步凸显了其原始能力。
主要启示
- Harness 仍然至关重要 —— 结构化支持能显著提升模型性能,这是 Semgrep Multimodal 领先的主要原因。
- 模型多样性是关键 —— 不要把所有安全任务绑定在单一 LLM 上,灵活切换可获得更好的成本与效果平衡。
- 开源权重模型已跨越重要门槛 —— 一年前开源模型在漏洞检测领域还处于边缘位置,如今 GLM 5.2 已能在特定任务上挑战前沿模型,同时具备本地部署优势。
注意:这是一个单一任务(IDOR)、单一数据集的结果,不能完全泛化到其他漏洞类型(如 SSRF)。Semgrep 表示会继续扩展测试。

We have Mythos at Home: GLM 5.2 beats Claude in our Cyber Benchmarks
OpenAI 发布预览 GPT-5.6 系列模型
OpenAI 于 2026 年 6 月 26 日宣布,正式启动 GPT-5.6 系列的有限预览。该系列包括三款模型:旗舰级 Sol、均衡型 Terra 以及快速经济型 Luna。
模型定位与亮点
- Sol:系列旗舰模型,具备 OpenAI 当前最强综合能力,在编码、生物学和网络安全等领域的 agentic 任务中表现出显著提升。
- Terra:平衡型日常工作模型,性能接近 GPT-5.5,但成本降低约 50%。
- Luna:速度最快、成本最低的选项,提供强悍能力的同时兼顾经济性。
GPT-5.6 Sol 引入全新 max reasoning effort 模式(深度思考)和 ultra 模式(通过 subagents 加速复杂工作流),在 Terminal-Bench 2.1 等基准测试中创下新 SOTA。
安全与防护
OpenAI 为 GPT-5.6 系列配备了史上最 robust 的安全栈,尤其针对高风险活动、敏感 cyber 请求和重复滥用进行了强化。通过多周的红队测试(包括大规模自动化 red-teaming,使用超过 70 万 A100-equivalent GPU 小时)和分层防护体系(模型级拒绝、实时分类器、账户级审查等),在提升能力的同时严格控制潜在风险。
模型目前未达到 Preparedness Framework 中的 Cyber Critical 阈值,更擅长帮助防御者发现和修复漏洞,而非执行端到端攻击。
发布策略与可用性
由于与美国政府的持续沟通,此次采用 limited preview 形式,先向少数 trusted partners 开放,后续将逐步向 ChatGPT、Codex 和 API 用户全面开放。OpenAI 强调这只是短期举措,旨在加速实现更广泛的可用性。
定价(per 1M tokens):
- Sol:$5 input / $30 output
- Terra:$2.50 input / $15 output
- Luna:$1 input / $6 output
同时支持改进的 prompt caching 机制,并计划于 7 月在 Cerebras 上推出高达 750 tokens/s 的高速版本。
Anthropic 还是达成了他的目的。
现在 OpenAI 的模型已经很难再按照以前那种“训练完直接上线”的方式正常推送了。
像 GPT-5.6 这类先进模型,需要先面向部分符合条件的 B 端客户提供,再由美国政府逐一审核才能交付。这已经不是单纯的技术产品迭代节奏了。
结合最近 GLM-5.2 的发布,以及 Anthropic 对中国公司“蒸馏”他们模型的指控来看,我们必须承认:顶级大模型的发布,已经不能再用普通的互联网产品逻辑去理解。它正在被实质性当作军民两用战略资产、网络空间武器来对待。谁能用、用多先进,已经上升到国家安全层面的管控问题。
这会带来几个明显的变化:首先是发布节奏会明显放缓。头部模型的对外开放速度大概率会大幅下降。
虽然模型本身的训练迭代可能还在继续,但拿到许可的少数公司,会优先用这些先进模型去建立自己的竞争优势。其次是准入门槛大幅提高。尤其是美国模型,使用权限会越来越严格,需要经过更严苛的安全审查和合规流程。美国大模型公司的护城河,正在从“模型是否最强”逐渐转向“能否被安全、合法、持续地交付”。
这本质上变成了一种受控的准入机制,和政府的关系权重明显上升。不过这也会带来一个值得关注的反噬效应:如果中国开源模型继续保持快速追赶和迭代,很有可能进一步蚕食美国闭源模型的市场份额。
当然,美国方面大概率会尝试对使用中国开源模型进行更严格的限制(比如禁止美国企业使用),但这种管制到底能执行到什么程度,目前还很难说。
苹果宣布涨价,市场可能要开始交易存储过于紧缺导致的需求毁灭
如果存储厂商的客户都被吸血吸成干尸了,最终真的会有美好的结局吗?
就像 2007-2008 年油价过高导致的通胀一样,当年全球原油需求极强、供给弹性低、价格快速上冲,油价在 2008 年 7 月冲到约 147 美元/桶,随后随着经济下行和需求塌陷快速崩落。 如果存储厂商的客户都被吸血吸成干尸了,最终真的会有美好的结局吗?
📢 苹果电脑产品全系涨价
iPad 11 起售价 ¥3799(之前¥2999)
iPad mini 起售价 ¥4799(之前¥3999)
iPad Pro 起售价 ¥10799 (之前¥8999)
iPad Air 起售价 ¥5999 (之前¥4799)
MacBook Neo 起售价 ¥5499 (之前¥4599)
Mac Mini 起售价 ¥5999 (之前¥4499)
MacBook Air 起售价 ¥9999 (之前¥8499)
MacBook Pro 起售价 ¥15999 (之前¥13499)
