个人环境下以 Codex 和 Open Code 为主,同时在业务中使用 Claude Code 的实际感受总结
你好,我是无能。
感觉好像没有什么综合性的总结,所以想随性地写写(尽可能公平地)使用各种工具后的想法。有很多立场先行的话(Position talk)。
毕竟每种工具的用法都不一样,真的能进行公平评价吗?虽然有这样的疑问...
各个模型的感想
Codex
平时主要使用的是 Codex。
在提议修复 Bug 及其实现方式的聪明程度方面,它是 OpenAI 的 LLM 模型,而且可能是在强大的基础设施环境下运行,响应速度很快,不会让人感到烦躁。因为它会以最小的修改来完成,所以执行 git diff 时看起来很清爽,但这一点随着其他 LLM 模型也变得聪明起来,感觉也不一定了。
基本上只要把有问题的调试日志传给它,大致都能解决,很少有卡壳的地方。
个人认为网页版 ChatGPT 的审查能力非常强大,在个人环境下,经常是在 ChatGPT 的审查和 Codex 之间往返。因为可以直接将讨论的结果反映到代码中,最终也减少了无用的提交。
而且,由于不消耗 Codex 的额度,建议与网页版 ChatGPT 配合使用。
个人预测在 IPO 之前,为了抬高估值,可能会增加重置机会,但目前通过与网页版往返,Token 的消耗完全没有减少,所以也没什么困扰。
我认为原生状态下基本无法进行多智能体(Multi-agent)式的用法,如果是那种情况,可能使用其他的编码代理(Coding Agent)会更好。
Open Code
我会用它来生成临时的 bash 脚本,或者直接调查粗糙的日志,以及想将简单的 Github Actions 应用到多个仓库等简单任务或调查类工作。模型方面,目前主要使用的是可以免费使用的小米模型 Mimo V2.5,特别是在使用多智能体运行调查任务时,效率非常高。
我也会让它总结 API 端点的实际响应调查,然后直接在 Codex 端进行实现。因为它会被学习,所以那种情况下的 API Key 我会立即撤销(Revoke)。
虽然安全意识很薄弱,但比起为了保护 API Key 而采取迂回的做法,这种方式最简单、最好。
基本上在核心编码方面用得不多。
额度方面,似乎是 9 小时额度,但目前只遇到过一次达到上限的情况,所以我认为相对于免费额度来说,它的额度是非常充裕的。
不过,就编码而言,目前我正在通过 Neuralwatt 使用 GLM-5.2,凭借其惊人的超长上下文,投喂一些连 Codex 都找不到的安全相关调查任务时,它经常能发现问题,非常实用。除了安全任务,在编码方面我也觉得 GLM-5.2 非常实用。没用过 Kimi,所以不清楚。
负面评价方面,如果反复启动和关闭,它会在 /tmp/ 下存放大量临时文件,等回过神来就无法启动了。
Claude Code
整体输出量很大,容易刷屏。在初期编写应用代码时可能不错,但如果要问是否想在个人开发中使用,感觉有点微妙。有时它会做出超出必要的实现,这让人有些困扰。
安全调查类的任务,现在因为 Fable 的审查太严重,完全没法用。
而且,我记得在个人计划中也是一样的,它与网页版的聊天额度是共用的,如果因为达到上限而无法使用就结束了。不过,我记得商业版的 ChatGPT/Codex 也是分开计算的,所以实际上可能是一样的。
不过,我喜欢的开发者 xroche 先生使用 Claude 重新开始维护了很久没维护的 HTTrack,所以这纯粹是因为我已经习惯了 Codex,只是我个人的负面印象而已。
如果说还有另一个负面印象,虽然应该认为 Anthropic 在商业营销方面做得很好,但有时我觉得实际情况与宣传不符。这可能是为了在 IPO 前抬高估值而做的,但他们正在进行一些让人产生疑问的活动,如下所示:
抑制中国 AI 开发速度的政策活动
阻止中国企业使用非法计算资源的活动
这些作为保护美国产业的发言人或许能发挥作用,但对中国半导体相关的限制确实让人感到同情,感觉在政治上不够圆滑,或者说对其可持续性表示怀疑。
而且过去 FTX / Alameda 持有股份这一点也让人有些不安。虽然已经作为破产清算完毕,仅仅是投资对象之一,但总有一种难以言喻的感觉。
结语
说实话,现在大部分模型都很优秀,所以在实现方面,只要好好使用,感觉差距并不大。但我还是希望那些只靠 Open Code 支撑的人能尝试一下 Codex。
结束。