Resumen de impresiones sobre el uso de Codex y Open Code en mi entorno personal mientras uso Claude Code en el trabajo
Hola, soy Munou.
Siento que no hay mucha información que resuma todo de manera integral, así que voy a escribir de forma un tanto desordenada (pero lo más justa posible) lo que pienso después de usar varias herramientas. Hay mucho de opinión personal.
Para empezar, ¿es posible evaluar de forma justa cuando cada una tiene un uso diferente?
Impresiones de cada modelo
Codex
Mi herramienta principal habitual es Codex.
La inteligencia para proponer correcciones de errores y cómo maneja la implementación es propia de los modelos LLM de OpenAI, y gracias a que corre en una infraestructura potente, la velocidad de respuesta es rápida y no resulta frustrante. Realiza las correcciones mínimas necesarias, por lo que al hacer git diff era fácil de leer, aunque últimamente otros modelos LLM también se han vuelto más inteligentes, así que ya no estoy tan seguro de que sea una ventaja exclusiva.
Por lo general, si le pasas un log de depuración con problemas, puede resolverlo casi todo y rara vez se queda atascado.
Personalmente, la capacidad de revisión de la versión web de ChatGPT es muy potente, y en mi entorno personal suelo alternar mucho entre las revisiones de ChatGPT y Codex. Como puedo reflejar los resultados de las consultas directamente en el código, al final se reducen los commits innecesarios.
Además, como no consume la cuota de Codex, recomiendo usarlo junto con la versión web de ChatGPT.
Mi predicción personal es que aumentarán las oportunidades de reinicio de cuota para inflar la valoración antes de la salida a bolsa (IPO), pero actualmente el consumo de tokens al alternar con la versión web no disminuye en absoluto, así que no tengo problemas.
Considero que, de forma nativa, básicamente no se puede usar para tareas de tipo multi-agente, por lo que en ese caso sería mejor usar otros agentes de codificación.
Open Code
Lo uso para tareas sencillas o de investigación, como crear scripts de bash desechables, investigar logs directamente o aplicar GitHub Actions simples a múltiples repositorios. Actualmente uso principalmente el modelo de Xiaomi, Mimo V2.5, que todavía se puede usar gratis, y su eficiencia es bastante buena, especialmente cuando se ejecutan tareas de investigación con multi-agentes.
También lo uso para resumir la investigación de respuestas reales de endpoints de API y luego implementar eso en el lado de Codex. Como aprende de los datos, en esos casos revoco la API Key inmediatamente.
Mi conciencia sobre la seguridad es un poco laxa, pero es más simple y mejor que hacer cosas complicadas para proteger la API Key.
Básicamente, no lo uso mucho para la codificación principal.
En cuanto a la cuota, parece que hay un límite de 9 horas, pero hasta ahora solo he llegado al límite una vez, por lo que creo que la cuota es bastante generosa para ser gratuita.
Sin embargo, en términos de codificación, actualmente uso GLM-5.2 a través de Neuralwatt, y gracias a su abrumadora longitud de contexto, me resulta muy útil porque encuentra problemas en tareas de investigación relacionadas con la seguridad que ni siquiera Codex detecta. Siento que GLM-5.2 es bastante práctico para la codificación más allá de las tareas de seguridad. No he usado Kimi, así que no lo sé.
En el lado negativo, si lo abres y cierras muchas veces, llena /tmp/ con archivos temporales y, antes de que te des cuenta, ya no puede arrancar.
Claude Code
En general, genera mucho contenido, por lo que "inunda" la salida. Puede ser bueno para la codificación inicial de una aplicación, pero si me preguntan si quiero usarlo para desarrollo personal, es una decisión difícil. A veces implementa más de lo necesario, lo cual puede ser un problema.
En cuanto a las tareas de investigación de seguridad, actualmente la censura de Fable es tan estricta que lo hace inservible.
Además, creo que incluso en el plan personal se trata igual que la cuota de chat de la versión web, por lo que si llegas al límite y no puedes usarlo, se acabó. Sin embargo, creo recordar que ChatGPT/Codex en el plan de negocios también se trataban como cuotas separadas, por lo que en la práctica podría ser lo mismo.
Dicho esto, el desarrollador xroche, a quien admiro, ha retomado el mantenimiento de HTTrack (que no se actualizaba hace tiempo) usando Claude, así que probablemente mi imagen negativa se deba simplemente a que me he acostumbrado a Codex.
Otra razón para mi imagen negativa es que, aunque deberíamos considerar que Anthropic es muy buena en marketing como negocio, a veces siento que hay una discrepancia con la realidad. Quizás sea algo que hacen para inflar su valoración antes de la IPO, pero realizan actividades que me generan dudas, como las siguientes:
Actividades políticas para frenar la velocidad del desarrollo de IA en China
Actividades para evitar el uso de recursos de computación no autorizados por parte de empresas chinas
Estas acciones pueden funcionar como un portavoz para proteger la industria estadounidense, pero tengo cierta simpatía por las regulaciones relacionadas con los semiconductores en China, y me parece que son torpes políticamente o dudo de su sostenibilidad.
Y el hecho de que FTX / Alameda tuviera acciones en el pasado también es un poco inquietante. Aunque ya se ha liquidado por la quiebra y solo fue uno de tantos destinos de inversión, me deja una sensación difícil de describir.
Conclusión
Sinceramente, hoy en día la mayoría de los modelos son excelentes, por lo que en términos de implementación no creo que haya mucha diferencia si se usan correctamente, pero para aquellos que solo aguantan con Open Code, me gustaría que probaran Codex al menos una vez.
Eso es todo.