Discusión sobre este post

Avatar de User
Avatar de Abel Caballero

Y, como en todo, entre el blanco y el negro, hay muchos grises. No es necesario usar Opus 4.7 para todo cuando Haiku es suficiente, igual que es un desperdicio coger el Ferrari para ir a por el Humus y el Guacamole al Mercadona del barrio…

Se pueden optimizar las llamadas a los modelos según las necesidades. E, incluso, existen soluciones como OpenRouter que te permiten usar modelos OSS sin pagar por tokens.

Esto va contra la soberanía, por supuesto. Pero pasa los que no somos Mercadona, nos puede servir. No siempre hay que pagar por el frontier full equip.

Por otro lado, no ttermino de ver que haya que hacer baseline contra un modelo frontier. Creo que habría que hacer estudios donde definas lo que es good enough y medir contra eso. Y con cada evolución de tu LoRa, medir si has mejorado. No necesitas estar a la altura del más listo para dar una buena experiencia.

En cualquier caso, esto va avanzando tan rápido que veo arriesgado decantarse por OSS ‘propio’ y ponerse a entrenarlo. Como dices, te estás cerrando a una versión y paaar a la siguiente puede ser más costoso. Habrá que ver qué recorrido de mejora tienen los modelos aún y cuándo empezar a estabilizarse la curva. Igual compensa esperar un poco y, llegado el caso, hacer como los ejemplos de cloud que pusiste y dar el salto más adelante.

Mercadona probablemente pueda permitirse hacerlo así, pero otros más pequeños creo que deberían centrarse en coger velocidad de crucero con modelos fuera y más adelante plantearse entrenar a uno propio.

Avatar de diego C.

Muy interesante el artículo, salvando las distancias, nos vemos reflejados en bastantes de las cosas que comentas. Son muchos los comentarios que me surgen, y entiendo que no puedes contestarlos todos, pero quería destacar dos cosas que me han llamado especialmente la atención.

La primera es la elección de Qwen3 8B. Me ha sorprendido que el modelo sea relativamente pequeño. ¿Cómo tomasteis esa decisión frente a variantes más grandes de la misma familia? ¿Fue principalmente por latencia, por coste de inferencia, o visteis que el salto de calidad no justificaba el coste extra de parámetros?.

La segunda es sobre infraestructura, justificar internamente una inversión inicial en hardware serio (varias H100 pueden superar fácilmente los 100k€) no es trivial antes de tener funcionalidades en producción con volumen que lo justifiquen. ¿Empezasteis con hardware más modesto o con capacidad cloud, con la idea de migrar a on-premise potente cuando las funcionalidades demuestren su rendimiento?. Me parece una de las partes difíciles de este viaje, a nosotros por lo menos nos pasa.

Y por último, la estrategia de una especie de "cata a ciegas" de productos que describes, replicar en Qwen lo que ya hacéis con Claude y cambiar solo cuando el resultado es satisfactorio, me parece genial, entiendo que para cada caso de uso hacéis diversas iteraciones y aproximaciones, comparando el resultado de los dos modelos, ¿os habéis encontrado para alguna funcionalidad en un punto de "este no es el camino" y tener de dar marcha atrás o abandonar?, como se determina ese punto de seguir iterando, o abandonar esta vía y replantear.

Muchas gracias por compartir esta información tan interesante.

saludos

diego

2 comentarios más...

Sin posts

Por supuesto, sigue adelante.