Ha salido un modelo nuevo. ¿De verdad hay que cambiar?
Cada pocas semanas sale un modelo nuevo y alguien del equipo hace la misma pregunta: ¿cambiamos?
Mi respuesta sincera suele ser “probablemente todavía no”.
Cuando tienes un agente funcionando en producción, cambiar el modelo es mucho más que actualizar una línea de código. Hay que volver a probarlo todo, comprobar que los prompts se siguen comportando como esperas y asegurarte de que nada se rompe en las respuestas. Todo eso lleva tiempo y dinero.
Lo que lo complica todavía más es que la mayoría de los casos de uso con los que trabajo no tienen un conjunto de pruebas automatizado. Alguien que conoce el dominio tiene que sentarse y revisar las respuestas una a una. En salud, esa persona suele ser un clínico o un experto cuyo tiempo es caro y escaso. Así que cada migración tiene un coste real que no aparece en ningún benchmark.
Por eso intento no decidir en función del anuncio de lanzamiento. Miro tres cosas. Cuánto nos costaría de verdad la migración, contando horas de revisión y el riesgo de que algo se rompa. Cuánto mejor sería el nuevo modelo para nuestro caso concreto, y si los usuarios lo notarían siquiera. Y si hay algo que nos obligue a movernos, como que retiren el modelo antiguo o que el proveedor le suba el precio (pasa más de lo que se cree: los modelos antiguos tienden a encarecerse cuando sale el nuevo).
Si la mejora es pequeña, el coste es alto y nada nos empuja, nos quedamos donde estamos. Muchas tareas, como clasificar tickets o extraer datos de documentos, ya funcionan bien con modelos de un par de generaciones atrás.