博客
实用工具、产品更新、技术笔记与增长实验。
AI 实时生成游戏有了新原型,但“能玩”仍要过三道关
PixVerse 展示了把实时世界模型、游戏规则与智能体编排放在一起的游戏引擎。它降低原型表达的门槛,却尚未证明能在低延迟、稳定规则和成本上替代成熟游戏管线。
智能体手机真正难的不是替你点 App,而是让每一步都能被你管住
STEPX Neo、Step AOS 和 Amoo 把智能体带进手机。它们是否值得等,不取决于演示有多流畅,而取决于跨应用授权、关键操作确认和失败后的可追溯性是否成立。

ChatGPT 终于学会别抢话了:GPT-Live 把语音 AI 拆成了两层
OpenAI 发布 GPT-Live,重点不只是更自然的语音,而是把实时对话和后台推理拆开。对语音产品来说,真正的变化是从一问一答,走向持续交互与可委派的工作流。

ChatGPT 要替你干活了,但 Work 真正卖的不是“自动化”
OpenAI 发布 ChatGPT Work:它能连接文件和应用、把大任务拆开并持续数小时。比功能清单更值得关注的是,AI 助手开始需要像同事一样被分配权限、定义边界和验收。
有些活儿,真没必要每次都请最贵的模型
分类、抽取和格式化这类重复工作,小模型往往更快也更省。把它和前沿模型搭配起来,比选一边站队更实在。
开源模型不收 API 费,不等于它真的便宜
GPU、运维、推理优化和宕机都会算进账里。自托管该不该做,不看口号,得先把自己的调用量和人力成本算出来。
别再问“哪个模型最好”,先把你的任务说清楚
写作、抽取、长推理和高频客服,要的不是同一种模型。成本、延迟、隐私和稳定性摆在一起,答案通常不是一个名字。
Agent 跑错了,别只盯着最后那句答案
一个 Agent 连着调用二十步工具,最后答错只是表象。想知道它为什么跑偏,得看见每次判断、调用和重试留下的轨迹。
别把上下文窗口,当成 Agent 的记忆
上下文会满、会贵,也会在下一轮消失。真正能长期工作的 Agent,得把眼前正在想的事和需要长期保存的事分开。
一个 Agent 开始自己跑以后,最先要补的不是能力
把 Agent 接上工具不难,难的是让它出错时停得下来、查得清楚、花得明白。这篇文章从真实系统里最容易漏掉的护栏、记忆、评测和成本说起。
JSON 能解析,不等于这条结果能放心用
模型吐出合法 JSON 只是第一关。字段含义、业务规则和失败时怎么收场,才决定它能不能进真实流程。
提示注入最麻烦的地方,不是几句脏话能不能过滤
外部内容一旦能影响模型,问题就不只是“输入清洗”。真正要守住的是权限、工具调用和输出落到系统里的那条边界。
少背一点提示词口诀,把任务交代明白就够了
不是每个请求都值得塞 few-shot、思维链和长系统提示。知道什么时候补信息、什么时候停手,比收集模板更有用。
RAG 回答得像那么回事,检索真的找对了吗?
只看最后一句答案,很难知道问题出在检索还是生成。把两段拆开测,才不用在模型看似正常时盲猜。
文档每 512 个 token 切一刀,不叫 RAG 策略
切分方式会直接改变模型能找回什么、丢掉什么。别照着教程填默认值,先看你的文档结构和用户究竟怎么问。
RAG 不是不胡说了,它只是更会把问题藏起来
三个 PDF 上跑通,不代表放进真实资料库也可靠。切分、向量、召回和资料过期,任何一环都可能让它看起来很像答对了。
仪表盘全绿,不代表你的 LLM 评审真的靠谱
模型会给出很自信的分数,但这些分数未必和人的判断一致。先拿人工标注对照,再谈把它接进质量流程。
评测工具买了一堆,真正缺的往往是一套好样本
模型、框架和指标都要靠标注样本落地。样本不贴近真实用户,再漂亮的评测分数也很难帮你做决定。
基准拿了 85 分,为什么上线后还是一团糟?
单一分数很省事,却常常掩盖真实任务里的错误。把检索、格式、事实和用户感受拆开看,才知道模型到底哪里不行。
AI 写代码很快,审代码这件事反而更不能省
代码生成越快,人越容易把审查当成拖慢进度的步骤。真正昂贵的却是没看出的权限、边界和回滚问题。
榜单第一的编程 Agent,放进你的仓库还好用吗?
SWE-bench 能告诉你模型大概有多强,却不能替你回答它懂不懂你的代码、测试和约定。更可靠的办法,是用自己的真实任务给它一次小规模试用。
账单写着 token,但钱到底花在哪个功能上?
总账单不会告诉你哪个流程最烧钱、哪个用户一直亏。把成本落到一次任务和一次调用上,才知道该优化哪里。
别把业务绑死在一家模型厂商身上
模型价格、限额和表现都会变。给关键流程留出路由和 fallback,不是为了追热点,而是为了某天出问题时还有路可走。
模型都在降价,为什么 API 采购反而更难了
便宜的价格很容易上头,但它解决不了迁移、稳定性和真实任务表现。价格战里最重要的,不是猜谁会赢,而是别把自己锁死。
Claude Code、Cursor、Copilot:别急着站队,先看你的活儿
三个工具都在变,宣传也都很响。选它们不该靠谁的榜单更漂亮,而该看你的仓库、团队习惯和真正想交出去的那份代码。

奈雪跌成仙股,不只是一场冷清的股东会
从 19.8 港元到不足 1 港元,变掉的不只是市场情绪。高端茶饮的门店、外卖和盈利逻辑,都在被重新算账。

阿宝开放公测,支付宝想把一句话变成一串办事流程
阿宝从邀测走向公测,重点不在多了一个聊天入口,而在于支付、出行、缴费等原本分散的事情,开始尝试由一句自然语言串起来。

Nano Banana 2 Lite 快的不只是出图,还有试错
Google 给 Gemini 图像生成补了一档更快、更便宜的选择。它未必适合每一张最终成片,却很适合把反复试图的成本压下来。

阿里限制 Claude Code:已确认的信息与仍缺证据的说法
多家媒体已交叉确认工作场景限制,但“后门”等技术指控不能与禁用决定混为一谈。本文分清现有证据,并给出团队评估 AI 编程工具的检查项。

Claude 降价了,开发者的账单却不一定会变轻
Sonnet 5 的单价更好看,但真正的成本还取决于 token、重试和工作流。对 Anthropic 来说,更难处理的也许是用户对账户和平台稳定性的担心。
GPT-5.6 先给谁用,比它跑了多少分更值得看
Sol、Terra 和 Luna 已经亮相,但入口并没有面向所有人打开。这次预览透露的,是开发者将面对怎样的前沿模型分层、定价和管理。