个人环境下以 Codex 和 Open Code 为主,同时在业务中使用 Claude Code 的实际感受总结

3 min

language: ja bn en es hi pt ru zh-cn zh-tw

你好,我是无能。

感觉好像没有什么综合性的总结,所以想随性地写写(尽可能公平地)使用各种工具后的想法。有很多立场先行的话(Position talk)。

毕竟每种工具的用法都不一样,真的能进行公平评价吗?虽然有这样的疑问...

各个模型的感想

Codex

平时主要使用的是 Codex。

在提议修复 Bug 及其实现方式的聪明程度方面,它是 OpenAI 的 LLM 模型,而且可能是在强大的基础设施环境下运行,响应速度很快,不会让人感到烦躁。因为它会以最小的修改来完成,所以执行 git diff 时看起来很清爽,但这一点随着其他 LLM 模型也变得聪明起来,感觉也不一定了。

基本上只要把有问题的调试日志传给它,大致都能解决,很少有卡壳的地方。

个人认为网页版 ChatGPT 的审查能力非常强大,在个人环境下,经常是在 ChatGPT 的审查和 Codex 之间往返。因为可以直接将讨论的结果反映到代码中,最终也减少了无用的提交。

而且,由于不消耗 Codex 的额度,建议与网页版 ChatGPT 配合使用。

个人预测在 IPO 之前,为了抬高估值,可能会增加重置机会,但目前通过与网页版往返,Token 的消耗完全没有减少,所以也没什么困扰。

我认为原生状态下基本无法进行多智能体(Multi-agent)式的用法,如果是那种情况,可能使用其他的编码代理(Coding Agent)会更好。

Open Code

我会用它来生成临时的 bash 脚本,或者直接调查粗糙的日志,以及想将简单的 Github Actions 应用到多个仓库等简单任务或调查类工作。模型方面,目前主要使用的是可以免费使用的小米模型 Mimo V2.5,特别是在使用多智能体运行调查任务时,效率非常高。

我也会让它总结 API 端点的实际响应调查,然后直接在 Codex 端进行实现。因为它会被学习,所以那种情况下的 API Key 我会立即撤销(Revoke)。

虽然安全意识很薄弱,但比起为了保护 API Key 而采取迂回的做法,这种方式最简单、最好。

基本上在核心编码方面用得不多。

额度方面,似乎是 9 小时额度,但目前只遇到过一次达到上限的情况,所以我认为相对于免费额度来说,它的额度是非常充裕的。

不过,就编码而言,目前我正在通过 Neuralwatt 使用 GLM-5.2,凭借其惊人的超长上下文,投喂一些连 Codex 都找不到的安全相关调查任务时,它经常能发现问题,非常实用。除了安全任务,在编码方面我也觉得 GLM-5.2 非常实用。没用过 Kimi,所以不清楚。

负面评价方面,如果反复启动和关闭,它会在 /tmp/ 下存放大量临时文件,等回过神来就无法启动了。

Claude Code

整体输出量很大,容易刷屏。在初期编写应用代码时可能不错,但如果要问是否想在个人开发中使用,感觉有点微妙。有时它会做出超出必要的实现,这让人有些困扰。

安全调查类的任务,现在因为 Fable 的审查太严重,完全没法用。

而且,我记得在个人计划中也是一样的,它与网页版的聊天额度是共用的,如果因为达到上限而无法使用就结束了。不过,我记得商业版的 ChatGPT/Codex 也是分开计算的,所以实际上可能是一样的。

不过,我喜欢的开发者 xroche 先生使用 Claude 重新开始维护了很久没维护的 HTTrack,所以这纯粹是因为我已经习惯了 Codex,只是我个人的负面印象而已。

如果说还有另一个负面印象,虽然应该认为 Anthropic 在商业营销方面做得很好,但有时我觉得实际情况与宣传不符。这可能是为了在 IPO 前抬高估值而做的,但他们正在进行一些让人产生疑问的活动,如下所示:

这些作为保护美国产业的发言人或许能发挥作用,但对中国半导体相关的限制确实让人感到同情,感觉在政治上不够圆滑,或者说对其可持续性表示怀疑。

而且过去 FTX / Alameda 持有股份这一点也让人有些不安。虽然已经作为破产清算完毕,仅仅是投资对象之一,但总有一种难以言喻的感觉。

结语

说实话,现在大部分模型都很优秀,所以在实现方面,只要好好使用,感觉差距并不大。但我还是希望那些只靠 Open Code 支撑的人能尝试一下 Codex。

结束。

Related Posts