Cómo elegimos un modelo
Un modelo no se elige por hype. Se elige por evaluación sobre prompts del cliente, coste, residencia de datos y fallos observados. Así lo corremos, en abierto.
Evaluamos los candidatos —OpenAI, Anthropic, Gemini, DeepSeek, GLM, Qwen, Mistral y open source local— sobre prompts reales de clientes en español, francés e inglés. La regla: un modelo no se elige por moda, se elige por fallos observados y coste defendible.
El marco antes que el modelo
Cinco restricciones definen la elección; el ranking llega después.
Elegir un modelo en 2026 no empieza por el leaderboard: empieza por tus restricciones. Un modelo que gana un benchmark en inglés puede fallar el español de tu operación, costar el doble por token o no residir donde tu cumplimiento exige.
El marco de Slash AI Lab: idioma, código, agentes, coste y privacidad. Cinco ejes medidos con los prompts del cliente —no con tareas genéricas— y comparados contra el mejor modelo genérico disponible como referencia.
Cómo corre la evaluación
Reproducible por diseño: cualquiera puede repetirla.
Recolectamos 30 prompts fijos por cliente o por industria —tareas reales de negocio, no juguetes— y los ejecutamos contra cada candidato en nube y, cuando aplica, en inferencia local.
Medimos cuatro cosas por corrida: calidad (juzgada contra criterios acordados), fallos observados (qué rompe el modelo cuando algo sale mal), coste por inferencia y latencia p95. El resultado se publica como comparativa por eje, no como puntaje único.
- Prompts: 30 fijos por cliente, versionados.
- Motores: 5 en la corrida actual (ver metodología completa en el lab).
- Idiomas: español de empresa, francés e inglés.
- Salida: comparativa por eje con recomendación reproducible.
Los fallos pesan más que los aciertos
Lo que rompe la confianza de producción son los errores, no los aciertos.
Un benchmark de aciertos premia lo fácil. Lo que decide un despliegue es qué pasa cuando el modelo se equivoca: ¿responde con confianza falsa?, ¿inventa fuentes?, ¿ignora el idioma del cliente bajo presión?
Por eso la evaluación incluye casos hostiles: prompts ambiguos, datos sucios, herramientas caídas y preguntas fuera de alcance. Si el modelo falla de forma peligrosa, vuelve al diseño — pase lo que diga el ranking.
Qué este estudio NO es
Sin humo: las limitaciones declaradas.
No es un ranking comprado ni patrocinado; no incluye modelos a los que no podemos dar carga real; y no sustituye la evaluación sobre tus propios prompts — es la base pública del método que corre en cada proyecto de Slash.
Lo esencial
- El marco: idioma, código, agentes, coste y privacidad — en ese orden de discusión.
- 30 prompts fijos por cliente, versionados y reproducibles.
- Los fallos observados pesan más que los aciertos del benchmark.
- Inferencia local cuando el cumplimiento lo exige.
- La evaluación se repite cada trimestre o cuando el mercado se mueve.
Las preguntas que escuchamos a menudo
¿Qué modelos entraron en la corrida?
OpenAI, Anthropic, Gemini, DeepSeek, GLM, Qwen, Mistral y open source local; la lista exacta está documentada en el lab.
¿Por qué 30 prompts?
Es el mínimo que separa suerte de consistencia en tareas reales de negocio; más prompts añaden coste sin cambiar la conclusión.
¿Por qué evaluar en español y francés?
Porque ahí se rompen los modelos: el español de empresa y el francés son idiomas de trabajo de Slash, no extras.
¿Puedo pedir una corrida con mis prompts?
Sí: una corrida acotada con tus prompts y un reporte reproducible.
¿Cuándo actualizan la comparativa?
Trimestralmente o cuando una novedad relevante justifica repetirla.
¿Y después de esto?
Slash AI Lab
El laboratorio donde evaluamos modelos y publicamos el método.
Saber más→ Fine-tuningFine-tuning y RAG
Cuándo ajustar el modelo y cuándo darle conocimiento propio. Criterio, no hype.
Saber más→ IAInteligencia artificial
IA aplicada a operación real: agentes, RAG, visión, voz y automatización.
Saber más→ InvestigaciónInvestigación
Publicamos criterio: modelos, RAG, pentest y visibilidad LLM.
Saber más→Pongámoslo en producción
Cuéntanos tu reto. Respondemos en menos de 24 horas con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.
Contesto personalmente. Sin formularios eternos ni respuestas automáticas.