博客

实用工具、产品更新、技术笔记与增长实验。

阅读时长 5 分钟

AI 实时生成游戏有了新原型,但“能玩”仍要过三道关

PixVerse 展示了把实时世界模型、游戏规则与智能体编排放在一起的游戏引擎。它降低原型表达的门槛,却尚未证明能在低延迟、稳定规则和成本上替代成熟游戏管线。

人工智能gamingvideo-aiproduct-news
阅读时长 4 分钟

智能体手机真正难的不是替你点 App,而是让每一步都能被你管住

STEPX Neo、Step AOS 和 Amoo 把智能体带进手机。它们是否值得等,不取决于演示有多流畅,而取决于跨应用授权、关键操作确认和失败后的可追溯性是否成立。

人工智能agentsmobileproduct-news
ChatGPT 终于学会别抢话了:GPT-Live 把语音 AI 拆成了两层封面
阅读时长 3 分钟

ChatGPT 终于学会别抢话了:GPT-Live 把语音 AI 拆成了两层

OpenAI 发布 GPT-Live,重点不只是更自然的语音,而是把实时对话和后台推理拆开。对语音产品来说,真正的变化是从一问一答,走向持续交互与可委派的工作流。

人工智能OpenAIvoice-aiproduct-news
ChatGPT 要替你干活了,但 Work 真正卖的不是“自动化”封面
阅读时长 3 分钟

ChatGPT 要替你干活了,但 Work 真正卖的不是“自动化”

OpenAI 发布 ChatGPT Work:它能连接文件和应用、把大任务拆开并持续数小时。比功能清单更值得关注的是,AI 助手开始需要像同事一样被分配权限、定义边界和验收。

人工智能OpenAIagentsproduct-news
有些活儿,真没必要每次都请最贵的模型封面
阅读时长 1 分钟

有些活儿,真没必要每次都请最贵的模型

分类、抽取和格式化这类重复工作,小模型往往更快也更省。把它和前沿模型搭配起来,比选一边站队更实在。

人工智能developer-tools模型新闻
开源模型不收 API 费,不等于它真的便宜封面
阅读时长 1 分钟

开源模型不收 API 费,不等于它真的便宜

GPU、运维、推理优化和宕机都会算进账里。自托管该不该做,不看口号,得先把自己的调用量和人力成本算出来。

人工智能developer-tools模型新闻
别再问“哪个模型最好”,先把你的任务说清楚封面
阅读时长 1 分钟

别再问“哪个模型最好”,先把你的任务说清楚

写作、抽取、长推理和高频客服,要的不是同一种模型。成本、延迟、隐私和稳定性摆在一起,答案通常不是一个名字。

人工智能developer-tools模型新闻
Agent 跑错了,别只盯着最后那句答案封面
阅读时长 2 分钟

Agent 跑错了,别只盯着最后那句答案

一个 Agent 连着调用二十步工具,最后答错只是表象。想知道它为什么跑偏,得看见每次判断、调用和重试留下的轨迹。

人工智能developer-tools模型新闻
别把上下文窗口,当成 Agent 的记忆封面
阅读时长 2 分钟

别把上下文窗口,当成 Agent 的记忆

上下文会满、会贵,也会在下一轮消失。真正能长期工作的 Agent,得把眼前正在想的事和需要长期保存的事分开。

人工智能developer-tools模型新闻
一个 Agent 开始自己跑以后,最先要补的不是能力封面
阅读时长 2 分钟

一个 Agent 开始自己跑以后,最先要补的不是能力

把 Agent 接上工具不难,难的是让它出错时停得下来、查得清楚、花得明白。这篇文章从真实系统里最容易漏掉的护栏、记忆、评测和成本说起。

人工智能developer-tools模型新闻
JSON 能解析,不等于这条结果能放心用封面
阅读时长 1 分钟

JSON 能解析,不等于这条结果能放心用

模型吐出合法 JSON 只是第一关。字段含义、业务规则和失败时怎么收场,才决定它能不能进真实流程。

人工智能developer-tools模型新闻
提示注入最麻烦的地方,不是几句脏话能不能过滤封面
阅读时长 2 分钟

提示注入最麻烦的地方,不是几句脏话能不能过滤

外部内容一旦能影响模型,问题就不只是“输入清洗”。真正要守住的是权限、工具调用和输出落到系统里的那条边界。

人工智能developer-tools模型新闻
少背一点提示词口诀,把任务交代明白就够了封面
阅读时长 1 分钟

少背一点提示词口诀,把任务交代明白就够了

不是每个请求都值得塞 few-shot、思维链和长系统提示。知道什么时候补信息、什么时候停手,比收集模板更有用。

人工智能developer-tools模型新闻
RAG 回答得像那么回事,检索真的找对了吗?封面
阅读时长 1 分钟

RAG 回答得像那么回事,检索真的找对了吗?

只看最后一句答案,很难知道问题出在检索还是生成。把两段拆开测,才不用在模型看似正常时盲猜。

人工智能developer-tools模型新闻
文档每 512 个 token 切一刀,不叫 RAG 策略封面
阅读时长 1 分钟

文档每 512 个 token 切一刀,不叫 RAG 策略

切分方式会直接改变模型能找回什么、丢掉什么。别照着教程填默认值,先看你的文档结构和用户究竟怎么问。

人工智能developer-tools模型新闻
RAG 不是不胡说了,它只是更会把问题藏起来封面
阅读时长 1 分钟

RAG 不是不胡说了,它只是更会把问题藏起来

三个 PDF 上跑通,不代表放进真实资料库也可靠。切分、向量、召回和资料过期,任何一环都可能让它看起来很像答对了。

人工智能developer-tools模型新闻
仪表盘全绿,不代表你的 LLM 评审真的靠谱封面
阅读时长 1 分钟

仪表盘全绿,不代表你的 LLM 评审真的靠谱

模型会给出很自信的分数,但这些分数未必和人的判断一致。先拿人工标注对照,再谈把它接进质量流程。

人工智能developer-tools模型新闻
评测工具买了一堆,真正缺的往往是一套好样本封面
阅读时长 2 分钟

评测工具买了一堆,真正缺的往往是一套好样本

模型、框架和指标都要靠标注样本落地。样本不贴近真实用户,再漂亮的评测分数也很难帮你做决定。

人工智能developer-tools模型新闻
基准拿了 85 分,为什么上线后还是一团糟?封面
阅读时长 1 分钟

基准拿了 85 分,为什么上线后还是一团糟?

单一分数很省事,却常常掩盖真实任务里的错误。把检索、格式、事实和用户感受拆开看,才知道模型到底哪里不行。

人工智能developer-tools模型新闻
AI 写代码很快,审代码这件事反而更不能省封面
阅读时长 1 分钟

AI 写代码很快,审代码这件事反而更不能省

代码生成越快,人越容易把审查当成拖慢进度的步骤。真正昂贵的却是没看出的权限、边界和回滚问题。

人工智能developer-tools模型新闻
榜单第一的编程 Agent,放进你的仓库还好用吗?封面
阅读时长 2 分钟

榜单第一的编程 Agent,放进你的仓库还好用吗?

SWE-bench 能告诉你模型大概有多强,却不能替你回答它懂不懂你的代码、测试和约定。更可靠的办法,是用自己的真实任务给它一次小规模试用。

人工智能developer-tools模型新闻
账单写着 token,但钱到底花在哪个功能上?封面
阅读时长 1 分钟

账单写着 token,但钱到底花在哪个功能上?

总账单不会告诉你哪个流程最烧钱、哪个用户一直亏。把成本落到一次任务和一次调用上,才知道该优化哪里。

人工智能developer-tools模型新闻
别把业务绑死在一家模型厂商身上封面
阅读时长 1 分钟

别把业务绑死在一家模型厂商身上

模型价格、限额和表现都会变。给关键流程留出路由和 fallback,不是为了追热点,而是为了某天出问题时还有路可走。

人工智能developer-tools模型新闻
模型都在降价,为什么 API 采购反而更难了封面
阅读时长 2 分钟

模型都在降价,为什么 API 采购反而更难了

便宜的价格很容易上头,但它解决不了迁移、稳定性和真实任务表现。价格战里最重要的,不是猜谁会赢,而是别把自己锁死。

人工智能模型新闻developer-tools
Claude Code、Cursor、Copilot:别急着站队,先看你的活儿封面
阅读时长 2 分钟

Claude Code、Cursor、Copilot:别急着站队,先看你的活儿

三个工具都在变,宣传也都很响。选它们不该靠谁的榜单更漂亮,而该看你的仓库、团队习惯和真正想交出去的那份代码。

人工智能developer-tools模型新闻
奈雪跌成仙股,不只是一场冷清的股东会封面
阅读时长 3 分钟

奈雪跌成仙股,不只是一场冷清的股东会

从 19.8 港元到不足 1 港元,变掉的不只是市场情绪。高端茶饮的门店、外卖和盈利逻辑,都在被重新算账。

消费商业资本市场中国市场新茶饮
阿宝开放公测,支付宝想把一句话变成一串办事流程封面
阅读时长 3 分钟

阿宝开放公测,支付宝想把一句话变成一串办事流程

阿宝从邀测走向公测,重点不在多了一个聊天入口,而在于支付、出行、缴费等原本分散的事情,开始尝试由一句自然语言串起来。

蚂蚁集团支付宝阿宝AI 助理生活服务超级 App
Nano Banana 2 Lite 快的不只是出图,还有试错封面
阅读时长 3 分钟

Nano Banana 2 Lite 快的不只是出图,还有试错

Google 给 Gemini 图像生成补了一档更快、更便宜的选择。它未必适合每一张最终成片,却很适合把反复试图的成本压下来。

人工智能GoogleGemini模型新闻
阿里限制 Claude Code:已确认的信息与仍缺证据的说法封面
阅读时长 3 分钟

阿里限制 Claude Code:已确认的信息与仍缺证据的说法

多家媒体已交叉确认工作场景限制,但“后门”等技术指控不能与禁用决定混为一谈。本文分清现有证据,并给出团队评估 AI 编程工具的检查项。

人工智能Anthropic模型新闻
Claude 降价了,开发者的账单却不一定会变轻封面
阅读时长 2 分钟

Claude 降价了,开发者的账单却不一定会变轻

Sonnet 5 的单价更好看,但真正的成本还取决于 token、重试和工作流。对 Anthropic 来说,更难处理的也许是用户对账户和平台稳定性的担心。

人工智能Anthropic模型新闻
GPT-5.6 先给谁用,比它跑了多少分更值得看封面
阅读时长 3 分钟

GPT-5.6 先给谁用,比它跑了多少分更值得看

Sol、Terra 和 Luna 已经亮相,但入口并没有面向所有人打开。这次预览透露的,是开发者将面对怎样的前沿模型分层、定价和管理。

人工智能OpenAI模型新闻