DeepSeekV4-Flash逼近闭源天花板,真正要比的是harness
1、LLM & LLMOps研究 / 国产模型 / DeepSeek
老金这两天完成了一个实测。
我让DeepSeekV4-Flash在Claude Code里做飞书工作台。它读取任务,整理优先级和风险,生成每天的播报卡片,再标出后续任务。215次响应,整条流程花了约1.5元。
中途也翻过车。定时任务第一次运行就报错,工作流还猜错过原因。我检查日志、配置和读回结果,再让它修改重跑,任务才真正跑通。
所以我的判断很明确。V4-Flash不是闭源模型平替,它会判断错,也不该脱离检查独自做决定。但有工具、日志、状态和复跑的harness托着,它已经能接住一条真实的中长流程。
OpenCode我没用过。不过这两天看到它的Go套餐消息,我专门去核了一下官方说明。首月5美元,之后10美元。它不是无限量,仍有5小时、每周和每月额度。但DeepSeekV4-Flash实在便宜,官方按典型使用模式估算,5小时能跑约31650次请求。
这条新闻让我回头看自己的1.5元实测,感觉更明显了。
模型调用正在从需要省着用的成本,变成可以让它多试几次、多查一次日志、多跑一次验证的材料。难题再换更强的模型,多模态再切对应模型。模型不是都用同一个,任务也不该只跑一遍。
这就是harness开始比模型本身更重要的原因。
当模型足够便宜又足够能干,真正稀缺的就不再是一次回答,而是把工作拆成一连串能试错、能读回、能收住的流程。