凌晨实测 DeepSeek Harness:4毛4,10多分钟做完一份调研PPT

——不是只让 AI 写几段文字,而是让它从调研一路干到交付

DeepSeek Harness 与 OpenAI Codex 调研 PPT 全部页面

昨天,DeepSeek Harness 社区版第一次公开发布,很多人都在关注,我也一样。

我本来想开一场直播,边安装边测试。结果网络有点卡,直播间也没什么观众,索性关掉直播。到了夜里零点多,我从下载安装、购买 API Key 开始,自己完整跑了一遍。

整个过程比我预想得顺。

为了看看它到底是不是“真能干活”,我又给了它一个比较完整的任务:

调研 DeepSeek Harness 和 OpenAI Codex,写一份对比报告,再做成 PPT 给我看。

10 多分钟后,Markdown 报告、11 页 PPT 和全部页面预览图都交付了。API 账单大约 0.44 元

这 4 毛 4 买到的,不是几段看起来正确的回答,而是一条从资料搜集、内容整理、PPT 生成到结果检查的完整工作流。

它先调研,没有急着写结论

DeepSeek Harness 刚发布,公开资料还不算多。它先读取本地安装包里的 README 和依赖信息,再去核对官方仓库和公开资料。

最终报告里有一个判断我觉得比较重要:DeepSeek Harness 和 Codex 看起来在比较,实际上并不完全处在同一个层级。

DeepSeek Harness 更像一套开源的 Agent 运行框架,官方强调“Everything is a Plugin”,模型、工具、技能、会话和界面都可以通过插件组合;Codex 则更像一套已经产品化的 Agent 工作环境,覆盖 CLI、IDE、桌面端和云端任务。

一个偏“搭 Agent 的框架”,一个偏“直接使用 Agent 的产品”。这比简单争论谁替代谁更有意义。

我也特意保留了报告中的提醒:跑分、模型参数和第三方媒体转述只能作为线索,不能因为做进了 PPT 就自动变成可靠结论。真正准备引用时,仍然应该回到官方原文。

第一次翻车,发生在生成 PPT 时

调研报告完成后,它开始写 11 页 PPT 的生成脚本,第一次运行就报错了:

TypeError: newObject.text.forEach is not a function

这一步最有价值的地方,不是“AI 也会报错”,而是它接下来怎么处理。

它没有围着同一条命令反复试,而是直接去读 pptxgenjs 的相关源码,最后发现文本和样式参数传错了格式。修改脚本后,PPT 顺利生成。

这也是我对 Agent 和普通聊天工具最直观的区别:聊天工具给你一个建议,Agent 会继续操作环境、读取源码、修改文件,再验证产物是不是真的存在。

为了看一眼效果,它又搭了一条渲染流程

PPT 文件生成成功,不等于 PPT 真能用。

文字会不会溢出?卡片有没有重叠?装饰元素会不会跑出页面?这些问题不把幻灯片渲染出来,很难发现。

于是它继续尝试 QuickLook、WPS 和 LibreOffice。中间还遇到过一次很典型的“假成功”:后台任务显示安装完成,真正检查二进制文件时却发现根本没有装好。

最后,它下载并调用 LibreOffice,把 PPT 转成 PDF 和图片,再进行检查。

但新的问题又来了:当时使用的模型不能直接看图,视觉审查的子任务也迟迟没有收敛。它最后换成程序化几何审计,检查页面边界、文本框高度和元素碰撞,找出了 3 处真实布局问题,修改后重新渲染,再检查一遍。

这段过程比那份 PPT 本身更值得记录:工具有短板并不可怕,关键是工作流里有没有验证和兜底。

4毛4,具体买到了什么

环节 大致耗时
搜集资料、读取一手信息 约 3 分钟
整理并生成对比报告 约 1 分钟
生成 PPT、定位报错并修复 约 3 分钟
渲染、检查并修复版面 约 4 分钟
合计 约 10 多分钟

整次任务的 API 消耗大约是 0.44 元

当然,这不意味着以后所有调研 PPT 都只值 4 毛 4。任务长度、模型价格、网络环境、资料复杂度和返工次数都会影响成本。这一次只是一次真实样本,不是行业报价,也不是实验室基准。

但它至少说明了一件事:以前需要先搜资料、再写文档、再打开 WPS 排版的多段工作,现在已经有机会被压缩成一次连续委托。

我最后的判断

这次体验有三个明显优点。

第一,安装、配置 API Key 和开始使用的门槛不高;第二,从调研到生成文件的链路比较完整;第三,遇到报错后能够继续读源码、换工具、做验证,而不是停在“建议你手动处理”。

但边界同样明显。

  1. 它仍是开发者预览版。 官方已经明确提醒后续可能有不兼容变更,稳定性和文档都还需要时间。
  2. 调研结果必须由人把关。 Agent 能标注来源层级,但不能保证上游资料本身没有问题。
  3. 视觉质量仍然需要验收。 程序可以检查越界和重叠,却不能完全代替人的审美判断。

所以我不会因为这一次成功,就下结论说它已经能替代所有调研、设计和编辑工作。

我更愿意把它看成一个很具体的信号:AI 正在从“回答我的问题”,变成“接走一段完整工作”。而人的责任,也从亲手完成每一步,逐渐变成定义任务、提供判断和验收结果。

这次产出的 PPT 不一定完美,但从凌晨零点的一句话,到一份可以打开、可以继续修改的交付物,只花了 10 多分钟和 4 毛 4。

对我来说,这就已经值得把它记录进 UP2U:AI 能不能帮一个人快速完成一次调研并交付 PPT?这一次,答案是可以。

下载与参考

说明:本文记录的是 2026 年 8 月 14 日的一次个人实测。DeepSeek Harness 正处于快速迭代阶段,产品状态与功能请以官方最新说明为准。