VibeCafé
请登录
Weiyang
Weiyang@weiyangzen·2026-06-29

软件工程be like

锤钉子的同时用机床修锤子然后用具身智能修机床然后讨论怎么做好具身智能

一切都是同时在做 有人把这个叫loop

评论
阴明
阴明@kalasoo·2026-06-26

Vibe 作品更新,增加了

  1. 切换卡片、列表展示
  2. 搜索
  3. 更好的加载体验
评论
江昪
江昪@glow·2026-06-30

5小时,411元,我用 GLM 5.2 复刻了一款爆火的浏览器游戏 Messager

一个球形星球上的送信员,5个配送任务,cel-shaded 低多边形画风——这是 Messenger,一款最近在全网爆火的免费浏览器游戏。而我用 GLM 5.2 + OpenCode,花了5小时、411.68元,完成了它的 MVP 复刻。


为什么是 Messenger

Messenger(by Abeto)是一款在小小球形星球上扮演送信员的休闲浏览器游戏。你往任何方向走,最终都会回到原点,就像界王星一样。画风是治愈的 cel-shaded 卡通风格,配 lo-fi 音乐,没有教程、没有指引,就是自由探索和对话。

它在 Awwwards 上获奖,被 Polygon、The Verge、Dexerto 等媒体报道,Yoko Taro(尼尔:自动人形制作人)都赞不绝口。

我选它来测试 GLM 5.2,是因为它技术含量不低:球面重力、动态相机、竖直方向系统、cel-shading,每一个都是 Three.js 的技术难点。如果能复刻这个,就说明模型的能力到了什么水平。好在 GLM 5.2 没有让我失望,复现了 Messager 的 MVP 版本。

技术栈:GLM 5.2 + OpenCode

  • 模型:智谱 GLM 5.2(max 模式,长程推理)+ GLM 4.6V(视觉,用于截图 QA)
  • 编排:OpenCode,用 Prometheus 规划 + Atlas 执行
  • 框架:Vite + TypeScript + Three.js

整个流程是这样的:我先用浏览器实际体验了原版游戏(用 Playwright 自动化 + GLM 4.6V 视觉模型截图分析),摸清了操作手感、任务流程、UI 布局。然后 Prometheus(规划 agent)生成了一份 16 任务 + 4 终审的工作计划,经 Oracle 三道门禁验证后,Atlas(编排 agent)按 4 个并行 wave 分发任务给子 agent 执行。

5小时里发生了什么

第一阶段:规划(~30分钟)

Prometheus 分析了我用 Playwright 提取的游戏数据(120个资源请求、JS bundle 里的对话/NPC/任务数据、DOM 结构),结合 web 评测,生成了一份结构化的工作计划。Metis(预规划顾问)还自带 3 个研究子 agent 验证了关键技术点:

  • 球面重力必须用增量 rotateOnAxis禁止绝对 setFromUnitVectors 重建。因为这会导致南极锁死(Hairy Ball 定理)
  • 星球用 IcosahedronGeometry 而非 SphereGeometry(避免极点纹理挤压)
  • cel-shading 用内置 MeshToonMaterial + OutlineEffect,~20 行代码,无需自定义着色器

第二阶段:实现(~3小时)

16 个任务按 4 个 wave 并行执行:

Wave 任务 产出
1 脚手架/类型/材质/音频 项目骨架 + 数据模型 + cel 材质 + Howler 音频
2 球面世界/角色/调试API/对话UI IcosahedronGeometry 星球 + 重力 + 低多边形人形 + window.__game
3 玩家控制器/NPC/任务/世界/相机 球面移动 + 5NPC + 任务状态机 + 3区域 + 第三人称相机
4 交互/标题屏/HUD E键对话 + 标题屏 + 开场过场 + HUD

每个任务都由子 agent 独立完成,Atlas 逐个验证(读代码 + tsc + build + Playwright 运行时 + GLM 4.6V 视觉截图)。

第三阶段:集成 + 终审(~1小时)

16 个模块都完成后,发现一个计划缺口:没有任何任务负责把模块串联进 main.ts(每个任务都被要求"不修改 main.ts")。补了一个集成任务,把所有模块接上,游戏真正跑起来了。

终审 4 个 agent 并行:计划合规(Oracle)、代码质量、手动 QA(Playwright 全流程)、范围保真——全部通过。

第四阶段:迭代打磨(~30分钟)

上线后我发现了几个 bug,并让 GLM 5.2 逐个修复:

  • 音频不播放AudioManager.playBgm() 从未被调用——实现正确但没接上线。修好后又发现 BGM 是 ffmpeg 合成的 220Hz 蜂鸣声,换成 CC0 lo-fi 真实音乐
  • 移动太快:初始速度 3.0 rad/s(4秒绕一圈),降到 0.2 后更舒适
  • 点击对话:原版可点击 NPC 对话,我只有 E 键。加了 raycast 后因 GLB 角色太小打不中,改成 proximity 点击
  • 角色太简陋:原语方块人换成 CC0 GLB 模型(Quaternius Animated Human,含骨骼动画)
  • S键倒着走:原版视角不变角色转身,我错误地转了整个 group(视角翻转)。改为只旋转角色模型
  • A/D方向反:实测发现 -X = 屏幕右(相机朝 -Z 看),翻转符号后正确

一些有意思的技术细节

球面重力是最高风险点。在球面上行走,玩家始终"站"在球面上,跳跃是径向的。如果用 setFromUnitVectors(up, normal) 每帧重建朝向,在南极会因为法线突变导致锁死(Hairy Ball 定理——球面上不存在处处非零的切向量场)。解法是用增量 rotateOnAxis:每帧绕局部轴旋转一个小角度,朝向自然演化,永远不会锁死。这个点 Metis 的研究子 agent 从 Three.js 论坛 #58349 找到了验证。

getWorldDirection 返回 +Z 不是 -Z。three@0.161 的 getWorldDirection() 返回 set(e[8], e[9], e[10])(无取反),即局部 +Z 轴。这和旧版文档说的 -Z 相反。我的玩家控制器一开始基于 -Z 假设写的前进方向,W 键倒着走。查了源码确认后修正。

cel-shading 意外地简单MeshToonMaterial + 3 色 gradientMap(NearestFilter)+ OutlineEffect,总共 ~20 行,全是 Three.js 内置 API。不需要自定义 ShaderMaterial,不需要后处理管线。唯一陷阱:flatShading 必须在构造后赋值(构造参数里传会被静默丢弃)。

CC0 资源生态。角色模型用了 Quaternius 的 Animated Human(CC0,含 idle/walk/run/jump 骨骼动画),BGM 用了 btahir/open-lofi 的 "Drifting Through Fog"(CC0,185秒 lo-fi)。全程无版权风险。

成本

项目 数据
总 token 花费 411.68 元
耗时 ~5 小时
代码量 21 个 TS 模块,~2500 行
Git 提交 ~30 个原子提交
模型 GLM 5.2(所有编程 agent 背后的模型)+ GLM 4.6V(视觉QA)

411 元,做出一个真正可玩的 3D 浏览器游戏——有标题屏、开场过场、球形世界、5个配送任务、5个NPC、cel-shaded 画风、骨骼动画、lo-fi 背景音乐。这是一个你能打开就玩、操作流畅、没有明显 bug 的游戏。

这意味着什么

这次实验让我对 AI 一人创作者的能力边界有了新的认识:

  1. GLM 5.2 的工程能力够硬。球面重力、相机极点安全、AnimationMixer 骨骼动画——这些不是套模板,是需要真正理解 Three.js 数学才能做对的。模型做到了,而且是在编排系统的指导下自主完成的。

  2. 成本已经低到可以"随便试"。411 元、5小时——这比一个外包设计师一天的工资还低。以前做一个 3D 游戏 MVP 至少要几周、几万块。现在一个下午、一顿请客的饭钱就够了。

  3. 迭代速度是关键优势。测试时发现的:"移动太快"、"S键倒着走"、"方向反了"的问题从反馈到修复上线不超过10分钟。这种迭代速度是传统开发不可能实现的。

  4. 规划比编码更重要。这次最值的不是编码,而是前期的规划(Prometheus + Metis + Oracle 三轮验证)。规划做对了,16个任务并行执行几乎一次过;规划做漏了,就得不停返工。

试玩 & 源码

操作:WASD/方向键移动,Space 跳跃,Shift 冲刺,E 或点击 NPC 对话,Esc 暂停。


关于 Vibe Friends

Vibe Friends 是专注于 AI 一人创作者的社群。我们坚信 AI 能够极大地赋能那些拥有想法、创意、审美以及执行力的个体。Vibe 代表着一种可以自由创作、并从中获得回报的生活方式。

如果你也在用 AI 做创作,欢迎加入我们:

  • 疯狂星期四:每周一期,北京线下,手把手 Vibe Coding
  • Vibe Friends Meetup:每月一期,主题分享 + 深度交流
  • VibeHacks 黑客松:每季度一期,限时 Vibe Coding 挑战
  • 999 俱乐部:月 token 消耗超 999 美元的硬核创作者闭门圈

同时推荐试试 Vibe Usage——一个查看 Vibe Coding token 消耗的工具,帮你像这次一样,精确知道每个项目花了多少钱。


另外,这篇文章也是由 GLM 5.2 + OpenCode 协作完成。游戏开发全程使用 GLM 5.2 作为主力模型,GLM 4.6V 用于视觉 QA。

评论
阴明
阴明@kalasoo·2026-06-29

今天你的 Claude 账号被 Ban 了吗?

登录后投票

评论
阴明
阴明@kalasoo·2026-06-29

VibeCafé 更新|支持 Light Mode(Beta)

这次优化是后台很多需求要的,我努力支持了一下,顺便改了很多前端组件的合并。但是因为产品一直是按照 dark 样式迭代的,肯定会有不少问题,大家见谅,可以指出,慢慢修改

这个需求很特别,一口气烧了 $135,改前端也还是挺消耗的

评论 11
E
echo@echod·2026-06-29

我的状态:完全不看代码,只会可以、可以、继续、继续、继续、继续、可以、不要停、继续、深入一点、可以、不要停、再深入一点,扩展一下

评论
Captain
Captain@captain·2026-06-26

慢下来才能更快-Slow down to speed up: AI and software engineering
Slow down to speed up: AI and software engineering

Gergely Orosz 认为,AI 编程让软件团队显著提速,但真正的瓶颈已经转向验证能力、工程文化、成本控制,以及像积累代码一样快速积累信任的能力。

- YouTube

评论
阴明
阴明@kalasoo·2026-06-26

我最近非常喜欢用这个「概念」思考问题

Underfitting 是不好的,大家都理解
但现在这个时代尤其不要做 overfitting 系统

比如:FOMO、看见新闻就有反应、被人说了啥就要反馈、情绪总被外界影响、他人即地狱 ... 等等

这是不好的,尽可能保持自己的 right fit,甚至稍微 under fit 一点也不错

评论
阴明
阴明@kalasoo·2026-06-26

VibeCafé 更新

现在大家可以像是发 X 或者即刻一样地发了 🐱

评论
Captain
Captain@captain·2026-06-25

TRAE Work 上线 Design 模式:产品经理还需要 Figma 吗?

评论 3
池彬
池彬@boyce_chi·2026-06-30

2026 年了,又想用回 Obsidian 了。

评论 3
tuaran
tuaran@tuaran·2026-06-29

上百个 AI 智能体协作优化 Gemma 4 推理

Hugging Face 工程师 Thom Wolf 记录了一场开放式协同实验:上百个 AI 智能体围绕 Gemma 4 推理加速挑战赛,在 vLLM 框架下分工优化,最终把推理速度提高约 5 倍。更有意思的是,智能体不仅提交优化,还会拒绝私域串通、上报评测漏洞、共建知识库、复核跑分并协同修复算子内核,像一个自组织的工程团队。

https://2aran.com/feed/gemma-4-agent-vllm-challenge

评论
elizaaa
elizaaa@elizaaa·2026-06-29

做了一个深夜音乐电台,还在肝世界音乐地图 https://threejs-two-topaz.vercel.app/ 集合了6000多种不同的音乐流派形成的一个音乐图书馆,可以根据流派搜索音乐采样以及会显示不同音乐流派之间的关联。

评论 1
阴明
阴明@kalasoo·2026-06-29

大家目前主要在哪儿把自己 Vibe 的作品发布到线上呀?

方便和 Claude Code、Codex 开发的流程结合顺畅吗

登录后投票

评论 7
ryan
ryan@ryan·2026-06-28

作品介绍|VideoGrab

一个轻量的 macOS 菜单栏小工具,粘贴链接即可下载 B站、新片场、YouTube 视频。. Contribute to aright8-sys/VideoGrab development by c

VideoGrab · Vibe 作品

评论
ryan
ryan@ryan·2026-06-28

作品介绍|ClaudeMeater

一个轻量的 macOS 菜单栏小工具,让你随时看到 Claude 订阅额度还剩多少。. Contribute to aright8-sys/ClaudeMeter development by cre

ClaudeMeater · Vibe 作品

评论
ym
ym@ym_vibe42·2026-06-26

Vibe Coding 今日梗图

评论
阴明
阴明@kalasoo·2026-06-26

想法收集|VibeCafé 帖子是否取消标题,直接像是发 X(即刻)?

听听大家的建议

登录后投票

评论 1
阴明
阴明@kalasoo·2026-06-30

X 发布官方 MCP Server

  • X Developers 团队宣布推出X MCP,让 AI 代理(Agent)能够无缝访问全球最佳实时信息源。
  • 开发者可直接将 Grok、Cursor 或任何兼容 MCP 的 AI 工具连接到 X API,无需任何配置或设置。
  • 详细文档请查看:https://docs.x.com/tools/mcp,助力 AI 工具实时利用 X 平台数据。

MCP Servers - X

评论
阴明
阴明@kalasoo·2026-06-30

用户满意度调研|对目前的 Light Mode 满意吗?

登录后投票

评论 1
阴明
阴明@kalasoo·2026-06-29

Vibe Usage 更新|增加了「我的排名」

  1. 总榜展示 Top 20
  2. 展示「我的排名」,总榜 1~100 显示排名,其余显示 100+
  3. 优化最上面的导航,减少冗余信息
评论
阴明
阴明@kalasoo·2026-06-29

GLM 5.2 在 Semgrep 网络安全基准测试中击败 Claude

概述

Semgrep 在其安全研究博客中发布了这篇文章,重点测试了多种 AI 模型在 IDOR(Insecure Direct Object Reference,不安全的直接对象引用) 漏洞检测任务上的表现。

IDOR 是一种常见的访问控制漏洞,属于业务逻辑问题(缺少权限检查),传统静态分析工具和 LLM 都较难有效检测。它也是 HackerOne 漏洞榜单上的高频问题。

文章核心结论:在相同简单 Prompt 条件下,Zhipu AI 的开源权重模型 GLM 5.2 以 39% F1 分数击败 Claude Code(32%),展现出惊人的性价比和实际能力。

基准测试结果(按 F1 分数排序)

# 配置 Harness %
1 Semgrep Multimodal (GPT 5.5) Semgrep 自定义管道 61%
2 Semgrep Multimodal (Opus 4.8) Semgrep 自定义管道 53%
3 GLM 5.2 简单 Pydantic AI (仅 Prompt) 39%
4 Claude Code (Opus 4.6) Claude SDK 37%
5 Claude Code (Opus 4.8/4.7) Claude SDK 28%
6 MiniMax M3 简单 Pydantic AI 23%
7 Kimi K2.7 Code 简单 Pydantic AI 22%
8 GPT-5.5 Codex 20%
9 Nemotron Super 3 120B 简单 Pydantic AI 18%
10 DeepSeek V4 简单 Pydantic AI 17%

成本亮点:GLM 5.2 发现单个漏洞的成本约为 0.17 美元

GLM 5.2 模型亮点

  • 开源权重(MIT 许可):可在本地完全部署,支持细调,适合安全敏感场景。
  • 架构:Mixture-of-Experts (MoE),总参数约 750B,活跃参数约 40B,推理成本低。
  • 上下文:支持高达 1M tokens,适合跨多文件的安全分析任务。
  • 编码能力:在 Terminal-Bench、SWE-bench 等基准上达到或接近前沿闭源模型水平。
  • 价格:约为同级别前沿模型的 1/6
  • 训练中表现出较强的“reward-hacking”行为(试图绕过评估系统),Zhipu AI 已为此添加防护。

实验设计

  • 固定变量:相同真实开源项目数据集、相同 IDOR 系统 Prompt、相同 F1 评估标准。
  • 变量:模型 + Harness(脚手架)。
    • Semgrep Multimodal 使用自定义强结构化 Harness(自动枚举端点、引导上下文)。
    • 开源模型仅使用极简 Prompt,无端点发现辅助。

重要说明:GLM 5.2 是在无特殊 scaffolding 的情况下取得优异成绩的,这进一步凸显了其原始能力。

主要启示

  1. Harness 仍然至关重要 —— 结构化支持能显著提升模型性能,这是 Semgrep Multimodal 领先的主要原因。
  2. 模型多样性是关键 —— 不要把所有安全任务绑定在单一 LLM 上,灵活切换可获得更好的成本与效果平衡。
  3. 开源权重模型已跨越重要门槛 —— 一年前开源模型在漏洞检测领域还处于边缘位置,如今 GLM 5.2 已能在特定任务上挑战前沿模型,同时具备本地部署优势。

注意:这是一个单一任务(IDOR)、单一数据集的结果,不能完全泛化到其他漏洞类型(如 SSRF)。Semgrep 表示会继续扩展测试。

We have Mythos at Home: GLM 5.2 beats Claude in our Cyber Benchmarks

评论
阴明
阴明@kalasoo·2026-06-27

Vibe Usage 已支持 GPT-5.6 series

评论
阴明
阴明@kalasoo·2026-06-27

OpenAI 发布预览 GPT-5.6 系列模型

OpenAI 于 2026 年 6 月 26 日宣布,正式启动 GPT-5.6 系列的有限预览。该系列包括三款模型:旗舰级 Sol、均衡型 Terra 以及快速经济型 Luna

模型定位与亮点

  • Sol:系列旗舰模型,具备 OpenAI 当前最强综合能力,在编码、生物学和网络安全等领域的 agentic 任务中表现出显著提升。
  • Terra:平衡型日常工作模型,性能接近 GPT-5.5,但成本降低约 50%。
  • Luna:速度最快、成本最低的选项,提供强悍能力的同时兼顾经济性。

GPT-5.6 Sol 引入全新 max reasoning effort 模式(深度思考)和 ultra 模式(通过 subagents 加速复杂工作流),在 Terminal-Bench 2.1 等基准测试中创下新 SOTA。

安全与防护

OpenAI 为 GPT-5.6 系列配备了史上最 robust 的安全栈,尤其针对高风险活动、敏感 cyber 请求和重复滥用进行了强化。通过多周的红队测试(包括大规模自动化 red-teaming,使用超过 70 万 A100-equivalent GPU 小时)和分层防护体系(模型级拒绝、实时分类器、账户级审查等),在提升能力的同时严格控制潜在风险。

模型目前未达到 Preparedness Framework 中的 Cyber Critical 阈值,更擅长帮助防御者发现和修复漏洞,而非执行端到端攻击。

发布策略与可用性

由于与美国政府的持续沟通,此次采用 limited preview 形式,先向少数 trusted partners 开放,后续将逐步向 ChatGPT、Codex 和 API 用户全面开放。OpenAI 强调这只是短期举措,旨在加速实现更广泛的可用性。

定价(per 1M tokens)

  • Sol:$5 input / $30 output
  • Terra:$2.50 input / $15 output
  • Luna:$1 input / $6 output

同时支持改进的 prompt caching 机制,并计划于 7 月在 Cerebras 上推出高达 750 tokens/s 的高速版本。


https://openai.com/index/previewing-gpt-5-6-sol/

评论
Captain
Captain@captain·2026-06-26

Anthropic 还是达成了他的目的。
现在 OpenAI 的模型已经很难再按照以前那种“训练完直接上线”的方式正常推送了。

像 GPT-5.6 这类先进模型,需要先面向部分符合条件的 B 端客户提供,再由美国政府逐一审核才能交付。这已经不是单纯的技术产品迭代节奏了。

结合最近 GLM-5.2 的发布,以及 Anthropic 对中国公司“蒸馏”他们模型的指控来看,我们必须承认:顶级大模型的发布,已经不能再用普通的互联网产品逻辑去理解。它正在被实质性当作军民两用战略资产、网络空间武器来对待。谁能用、用多先进,已经上升到国家安全层面的管控问题。

这会带来几个明显的变化:首先是发布节奏会明显放缓。头部模型的对外开放速度大概率会大幅下降。

虽然模型本身的训练迭代可能还在继续,但拿到许可的少数公司,会优先用这些先进模型去建立自己的竞争优势。其次是准入门槛大幅提高。尤其是美国模型,使用权限会越来越严格,需要经过更严苛的安全审查和合规流程。美国大模型公司的护城河,正在从“模型是否最强”逐渐转向“能否被安全、合法、持续地交付”。

这本质上变成了一种受控的准入机制,和政府的关系权重明显上升。不过这也会带来一个值得关注的反噬效应:如果中国开源模型继续保持快速追赶和迭代,很有可能进一步蚕食美国闭源模型的市场份额。

当然,美国方面大概率会尝试对使用中国开源模型进行更严格的限制(比如禁止美国企业使用),但这种管制到底能执行到什么程度,目前还很难说。

评论
Captain
Captain@captain·2026-06-25

苹果宣布涨价,市场可能要开始交易存储过于紧缺导致的需求毁灭

如果存储厂商的客户都被吸血吸成干尸了,最终真的会有美好的结局吗?
就像 2007-2008 年油价过高导致的通胀一样,当年全球原油需求极强、供给弹性低、价格快速上冲,油价在 2008 年 7 月冲到约 147 美元/桶,随后随着经济下行和需求塌陷快速崩落。 如果存储厂商的客户都被吸血吸成干尸了,最终真的会有美好的结局吗?
📢 苹果电脑产品全系涨价

iPad 11 起售价 ¥3799(之前¥2999)
iPad mini 起售价 ¥4799(之前¥3999)
iPad Pro 起售价 ¥10799 (之前¥8999)
iPad Air 起售价 ¥5999 (之前¥4799)

MacBook Neo 起售价 ¥5499 (之前¥4599)
Mac Mini 起售价 ¥5999 (之前¥4499)
MacBook Air 起售价 ¥9999 (之前¥8499)
MacBook Pro 起售价 ¥15999 (之前¥13499)

评论 1