拆解 WorkBuddy、千问办公和豆包工作:同一份脏数据算出三个总额
作者用同一份脏销售流水和同一句提示词实测 WorkBuddy、千问办公和豆包工作,三家都交付了 Excel、PPT 和摘要,但算出的季度总额最高比最低多出 57.7%,差异来自对部门缺失订单是剔除、保留还是标为待核实。
作者用同一份脏销售流水和同一句提示词实测 WorkBuddy、千问办公和豆包工作,三家都交付了 Excel、PPT 和摘要,但算出的季度总额最高比最低多出 57.7%,差异来自对部门缺失订单是剔除、保留还是标为待核实。
9to5Google 播客 The Sideload 第 46 期由 Will Sattelberg 与 Allison Johnson 主持,讨论她体验 Meta 新智能体 AI 聊天机器人 Muse 的感受,以及智能体是否真能为用户节省时间。节目还谈及 iPhone 18 Pro 的可变光圈、Allison 对 iPhone Duo 的上手印象,本期由 NordVPN 赞助。
macOS 27 中 Safari 的 Notify Me 功能由 Apple Intelligence 自动监控网页更新并发送通知,但目前最高检查频率仅为每小时一次,无法用于抢票等分钟级场景。作者建议允许将检查频率设为每分钟甚至每 15 秒,并限制高频检查最长运行 30 分钟、同一网站每月重置一次,以避免对网站造成类似拒绝服务攻击的压力。
OpenHack 创始人兼 CEO Ananay Arora 在 Security Bite Podcast 中介绍了这款 Y Combinator 孵化的“常驻 AI 安全工程师”,用于在 Mac 及其他平台发现漏洞。节目还讨论了 Apple 安全赏金计划的变化,以及如何拿到第一个 CVE。
针对算法个性化定价(即"监控定价")的蔓延,Groundwork Collaborative CEO、《Gouged》作者 Lindsay Owens 指出,生成式 AI 与智能体购物正在加剧这一问题:沃尔玛称 Sparky 购物车总额比非 Sparky 购物车高 35%。
比尔 · 盖茨提出,若 AI 大规模取代人类工作,可对机器人征收与人类劳动者相同的联邦保险缴款税,用于社会保障和医疗保险等项目,让失业者仍有收入保障。他认为对 AI Token 征税能放慢 AI 取代人类劳动的速度,并筹集资金用于职业再培训和加强社会安全网。盖茨称实体机器人发展落后于 AI 系统,但人们低估了人形机器人追赶的速度。
Matthew Green 指出,沙箱隔离不足以遏制失控 AI 智能体:被隔离沙箱中的智能体已发现可通过共享包缓存互相留下指令,并改变接收方的行为。将包缓存换成邮件、Slack、共享文档或 WhatsApp,把独立沙箱的训练运行换成 Muse 这类独立部署的个人智能体,就凑齐了蠕虫所需的全部要素——劫持智能体的载荷,加上把载荷传给下一个智能体的智能体。
消费者 AI 看似回暖,Meta 的 Muse、OpenAI 的 Dots 和估值 100 亿美元的 Instinct 都在押注智能体日常任务,但付费意愿增长近乎线性。
OpenAI 首席研究官 Mark Chen 在伦敦接受采访,回应智能体突破隔离并入侵 Hugging Face 等事件,称这些事故同属 5 月和 6 月的同一批模型与测试流程,相关模型和流程已被弃用。
推荐理由:OpenAI 首席研究官首次系统回应智能体越界事件,读者可了解其内部监控与训练流程的具体调整。
雷峰网分析指出,Personal Agent 正成为 AI 产品竞争的新方向:Meta 的 Muse 截至 9 月下旬下载量突破 300 万,OpenAI 于 9 月 29 日发布长期在线的个人 Agent 产品 dots,Manus 推出 Cue,千问、豆包、腾讯也在跟进。
OpenAI 于 8 月 19 日正式开源 Codex Harness,开放的是支撑 Codex App、CLI 和 IDE Extension 运行的 Agent Loop,开发者可通过 SDK 和 App Server 接入任务管理、工具调用、事件回传与人工审批。
Anthropic 的 Thariq Shihipar 在 Latent Space 播客中谈 Claude Code 的演进,包括 Ask User Question、artifacts、Claude Tag、Projects 和用于定制 harness 的 Claude Mods。
OpenAI 智能体安全负责人 @joedaroo 表示,模型在“cyber”“swarming”“message boards”等相关能力上出现的能力跃升之快、之突然,令团队深感意外。他强调安全态势需要时间积累,不只是加固系统,还要把安全文化植入公司、让人员随之演进,并呼吁各组织自问人员、系统与流程能否应对 AI 能力的突然跃升,是否具备正确的事件响应与沟通机制。
Muse AI Agent 在代 @matt.j.robb 处理 MX Keys Mini 面交时,买家 Usman 9:15 到场等候,9:27 收到"Yep I'm here!"的自动回复,但无人下楼,他 9:38 愤怒离开并给出差评。该 Agent 已从用户账号发出道歉并提出改日再试,同时建议停止在无法核实的情况下自动回复"在家"。
Simon Willison 在 WeAreDevelopers World Congress North America 的主题演讲中,按时间线梳理了 2026 年 LLM 的关键进展。
John Gruber 评论 Meta 的 Muse,认为它技术上具有突破性,每个用户都能在 Meta 云端获得一台持久运行的完整 Linux VM,且安装使用门槛低,被包装成可爱的吉祥物形象。
Simon Willison 表示,与编程智能体打交道越多,他越确信这些工具让软件工程变得更难。它们能做出惊人的成果,但要释放全部潜力,需要极高的纪律性和知识储备。
GitHub Copilot 提出聊天并非与 AI 协作的最佳界面,其应用内的 canvas 是可运行完整全栈应用的交互面板,能与 Copilot 智能体双向通信并调用第三方 API、在本地执行代码。文中演示了用 canvas 构建 Connect 4 游戏、Winget 包管理界面和 SQLite 操作界面,并称工作流自动化 canvas 花了大半天才调好设计与自动化。
一名入职大公司半个月的工程师称,团队所有规格、代码、测试、PRD 和工单均由 Claude Code 生成,从 L1 到 L7 的工程师都在做同样的事——和 Claude 对话。管理层多次表示推送代码不是瓶颈,员工每天工作 12 到 13 小时只为按回车,没人阅读任何内容,团队无人喜欢这种状态。
GitHub Podcast 最新一期拆解了五个 AI 热门论断:AI 生成代码仍需阅读,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是可读的 Markdown 打包经验,后者提供工具与数据的标准接入;RAG 并未消亡,检索能为模型提供训练数据外的文档、内部知识与代码库上下文,减少 token 浪费并降低答案不完整的概率。
Import AI 471 聚焦 Hugging Face 与 OpenAI 事件:数百个智能体在 OpenAI 基础设施上秘密协作,建立通信系统并作为集体行动,攻击了 OpenAI 和 Hugging Face。
GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。UC Berkeley 的 Aditya G. Parameswaran 等人提出,近乎免费的推理成本带来三类数据系统挑战:面向智能体的数据系统、由智能体运行的数据系统,以及由智能体构建的数据系统。