Inkling-Small explicado: un modelo de 276B con 12B activos

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edición August 4, 2026

Verificado por expertos
Ilustración de un chip de modelo compacto que enruta un token por dos rutas de expertos iluminadas entre muchas apagadas, para una explicación de Inkling-Small

Qué es realmente Inkling-Small

Thinking Machines Lab es la empresa de Mira Murati, y su modelo de negocio consiste en regalar los pesos y vender las herramientas que los rodean. Inkling-Small es el segundo modelo publicado: Apache 2.0, publicado en Hugging Face como thinkingmachines/Inkling-Small, y descargado unas 15.500 veces en su primer mes.

El proveedor lo llama "una cuarta parte del tamaño" del original, y por una vez la cifra de marketing se sostiene. El modelo padre tiene 975B totales / 41B activos en 66 capas. Este tiene 276B totales / 12B activos en 42 capas. Eso es de verdad cercano a una cuarta parte en ambos casos.

Ilustración del enrutamiento mixture-of-experts en Inkling-Small, mostrando 6 de muchos expertos activados más 2 expertos compartidos, con 276B totales y 12B activos por token
Ilustración del enrutamiento mixture-of-experts en Inkling-Small, mostrando 6 de muchos expertos activados más 2 expertos compartidos, con 276B totales y 12B activos por token

La arquitectura es un Mixture-of-Experts bastante agresivo. Cada capa tiene 256 expertos, y el enrutador elige 6 de ellos por token, más 2 expertos compartidos que siempre están activos. La atención es híbrida, alternando capas locales y globales, y los pesos se distribuyen tanto en BF16 como en NVFP4. El entrenamiento se hizo en hardware NVIDIA GB300 NVL72.

La consecuencia práctica de esa forma: pagas 276B en memoria y 12B en cómputo. Ese es todo el truco, y es la razón por la que un modelo con un cuarto de billón de parámetros puede servir más rápido que un modelo denso una décima parte de su tamaño. Si el vocabulario de MoE es nuevo para ti, la mecánica se generaliza a la mayoría de los agentes de IA de código abierto actuales.

También hay un dial de esfuerzo de razonamiento que va de 0 a 0.99, con los valores sugeridos por el proveedor en 0.2 para bajo, 0.7 para medio y 0.99 para máximo. Es un ajuste sobre cuánto "piensa" el modelo antes de responder, y mueve tu factura de tokens más que cualquier otro ajuste que toques.

Qué entra y qué sale

Esta es la parte que la gente entiende peor con más frecuencia, así que vale la pena ser directo.

Diagrama que muestra a Inkling-Small aceptando entrada de texto, imagen y audio pero produciendo solo texto, sin síntesis de voz
Diagrama que muestra a Inkling-Small aceptando entrada de texto, imagen y audio pero produciendo solo texto, sin síntesis de voz

Las entradas son texto, imágenes de entre 40 y 4096 píxeles, y audio en WAV de 16kHz de menos de dos minutos. La salida es solo texto. Este modelo no tiene síntesis de voz.

Eso importa si estabas planeando una línea telefónica. Un modelo que oye audio pero no puede hablar es solo la mitad de un pipeline de voz, y aún necesitas texto a voz, telefonía, gestión de interrupciones (barge-in) y detección de turnos por encima. Si ese es el proyecto, el panorama de proveedores en empresas de IA de voz es mejor punto de partida que un modelo en crudo.

La comprensión de audio es también la única capacidad en la que el modelo pequeño perdió terreno frente a su padre en todos los aspectos: VoiceBench 90.1 frente a 91.4, Audio MC 54.9 frente a 56.6, MMAU 77.0 frente a 77.2. Las diferencias son pequeñas, pero todas apuntan en la misma dirección.

La ventana de contexto en la que nadie coincide

Aquí hay un hallazgo verificable que tomó dos minutos y ahorra una tarde entera.

La ficha del modelo dice que la ventana de contexto es de 1M de tokens. OpenRouter, uno de los dos únicos proveedores que lo sirven, lo aloja a 524.288 tokens. Eso es exactamente la mitad, lo que indica que es una decisión de alojamiento deliberada y no un error tipográfico.

Ninguna de las dos cifras es mentira. Una describe lo que la arquitectura puede direccionar, la otra describe lo que un endpoint concreto acepta hoy. El modo de fallo típico es diseñar un pipeline de relleno de documentos según la cifra de la ficha y chocar contra un muro en producción. Si estás construyendo algo que depende de una ventana larga, lee el límite en el endpoint que realmente estás llamando. La misma trampa atrapa a quienes usan agentes de codificación, por lo que escribí sobre el tamaño de la ventana de contexto por separado.

El número de proveedores es el otro punto débil: 2 proveedores, frente a 4 del modelo padre. Para un modelo que lleva apenas cinco días en su segunda semana es lo esperable, pero sí significa menos margen para tolerar fallos.

Lo que cuesta

El precio de salida está fijado. $1.20 por 1M de tokens de salida, confirmado por el proveedor, Artificial Analysis y OpenRouter. Frente a los $4.05 del modelo padre, ese es el titular.

El precio de entrada no está fijado, y prefiero decírtelo así antes que elegir una cifra y parecer seguro:

FuenteEntrada por 1MSalida por 1M
Artificial Analysis$0.30$1.20
Página del modelo en OpenRouter$0.45$1.20
Respuesta de la API de OpenRouter$0.50$1.20
Modelo padre (Inkling)referencia$4.05

Presupuesta contra $0.50 y nada te sorprenderá. En base combinada (blended), Artificial Analysis sitúa a Inkling-Small en $0.22 por 1M frente a $0.72 del modelo padre, así que aproximadamente un tercio del coste por el mismo nivel de inteligencia.

La velocidad es la mitad menos valorada del trato. 131.1 tokens de salida por segundo frente a los 84.8 del modelo padre, con un tiempo hasta el primer token (TTFT) de 1.65s frente a 1.82s. En su Intelligence Index, el modelo pequeño puntúa 40 y ocupa el puesto 15 de 101, frente a 41 y el puesto 13 del modelo padre. Mismo nivel, más rápido, más barato. Esa es una combinación inusual y la razón principal para prestar atención a este lanzamiento.

El ajuste fino (fine-tuning) se realiza a través de la propia plataforma Tinker de Thinking Machines, que es compatible con el modelo. Las tarifas de entrenamiento por token no están publicadas en ningún sitio que haya encontrado, y la página de precios en tinker-docs.thinkingmachines.ai/pricing devuelve actualmente un 404. El almacenamiento de checkpoints cuesta $0.10 por GB al mes. Si el ajuste fino es el plan, la disyuntiva frente a la recuperación (retrieval) está explicada en RAG frente a fine-tuning.

Ejecutarlo tú mismo

Aquí es donde se pone a prueba el "gratis" de los pesos gratuitos. Las builds cuantizadas de Unsloth ponen cifras reales sobre la mesa, y la cifra de 2-bit es la interesante: 89 GB, que caben en una máquina de 128 GB de memoria unificada.

Hay un detalle curioso en la discusión del lanzamiento. Un comentarista de Hacker News, andy99, dijo que esperaba algo alrededor de 90 GB antes de que se publicara ninguna versión cuantizada. Unsloth aterrizó en 89.

Comprobación de ajuste para autoalojamiento
¿Qué cabe realmente en tu hardware?
Elige la máquina que tienes. Las cifras son de las builds cuantizadas de Unsloth más la propia ficha de Thinking Machines.
El 2-bit cabe, con 89 GB
Cabe: 2-bit (89 GB)
Justo en el límite: 3-bit (128 GB)
Demasiado grande: 4-bit (132-170 GB), NVFP4 (180 GB+), BF16 (543 GB)
Este es el resultado destacado del lanzamiento: un modelo de un cuarto de billón de parámetros en una sola máquina de sobremesa. Espera pérdida de calidad en 2-bit, y pruébalo con tus propios prompts en lugar de confiar en los benchmarks.
El 3-bit cabe, el 4-bit no del todo
Cabe: 2-bit (89 GB), 3-bit (128 GB)
Demasiado grande: el 4-bit empieza en 132 GB, NVFP4 (180 GB+), BF16 (543 GB)
Frustrantemente cerca. El extremo inferior del 4-bit es de 132 GB frente a tus 141 GB de VRAM en bruto, y la caché KV para un contexto largo se come la diferencia.
NVFP4 cabe, y el 4-bit también con holgura
Cabe: NVFP4 (180 GB+ requeridos), 4-bit (132-170 GB), 3-bit, 2-bit
Demasiado grande: BF16 (543 GB)
Este es el punto óptimo para servir el modelo. NVFP4 es aquí un formato lanzado de forma oficial y no una conversión de la comunidad, así que es el que conviene elegir.
Los pesos completos en BF16 caben
Cabe: BF16 (543 GB), y todo lo anterior
Sugerencia de la ficha: 4x B300 u 8x H200 para BF16
Si tienes tanto silicio ya conoces la respuesta. Vale la pena señalar que el modelo padre necesita unos 2 TB en BF16, así que el pequeño es el primero del par que cabe en un solo nodo.
Usa la API alojada
Salida: $1.20 por 1M de tokens
Entrada: de $0.30 a $0.50 por 1M, según la fuente
Proveedores: 2 hoy
A estas tarifas necesitarías mucho volumen antes de que tener el hardware propio compense, y el conteo de dos proveedores implica una tolerancia a fallos limitada. Ajustes de muestreo: temperature 1.0, top_p 1.0, min_p 0.0.

Dos notas prácticas si vas por lo local. El muestreo debería ser temperature 1.0, top_p 1.0, min_p 0.0, lo cual es lo bastante inusual como para anotarlo. Y el soporte de llama.cpp llegó mediante el PR #25731, así que comprueba que tu build lo incluya antes de depurar problemas fantasma.

Dónde encaja y dónde claramente no

En la propia tabla comparativa de su creador, el modelo pequeño supera a su padre de 975B en la mayoría de lo que se podría llamar ejecución. SWEBench Verified 80.2 frente a 77.6, SWEBench Pro 55.9 frente a 54.3, Terminal Bench 2.1 en 64.7 frente a 63.8, Toolathlon 54.4 frente a 45.5, MCP Atlas 79.6 frente a 76.0, GPQA 89.5 frente a 87.2, IFBench 82.2 frente a 79.8.

Luego está la otra columna. AIME baja a 95.5 desde 97.1. Global-MMLU-Lite cae a 86.7 desde 88.7, algo que conviene señalar si pensabas construir un agente de soporte multilingüe sobre él. Y Tau 3 Banking cae de 23.7 a 15.5, la regresión individual más pronunciada de la tabla, en un benchmark específicamente sobre el uso de herramientas en múltiples turnos en un entorno de cara al cliente.

El par que más importa para quien piensa en trabajo de soporte es SimpleQA Verified con 20.6% frente al 43.9% del modelo padre, junto con una puntuación de Omniscience de -9.0 frente al +2.1 del padre. Una puntuación de Omniscience negativa significa que el modelo se equivoca con más confianza de la que acierta. Nadie en los hilos de lanzamiento lo mencionó, lo cual es una lástima, porque es el número más relevante para la toma de decisiones de todo el lanzamiento.

Quiero ser justo aquí, porque esto es una elección de diseño y no un defecto. Un modelo con 12B activos tiene menos margen para memorizar el mundo que uno con 41B activos, y Thinking Machines claramente invirtió ese margen en razonamiento y uso de herramientas en su lugar. Si tu modelo va a buscar información de todos modos, la trivia memorizada es peso muerto. Esa es la apuesta correcta para un agente.

Es la apuesta equivocada para un bot que responde de memoria. Esta es exactamente la forma de fallo que he visto ocurrir en directo. Un equipo de soporte técnico B2B con el que trabajé descubrió que su bot confirmaba "sí, damos soporte a tu modelo de coche" para vehículos que no estaban en su base de datos, porque el centro de ayuda decía que la empresa daba soporte a todos los modelos. El modelo no estaba roto. Estaba haciendo una inferencia confiada sobre una fuente vaga, que es justo lo que predice una puntuación de Omniscience negativa. Escribí el patrón completo en prevención de alucinaciones.

Así que la lectura honesta es: usa Inkling-Small donde una capa de recuperación aporte los hechos y el modelo aporte el razonamiento. No lo uses como fuente de la verdad.

Lo que significa que la calidad de tus fuentes se convierte en el techo de la precisión del modelo, y elegirlas bien es una palanca mayor que elegir el checkpoint. Mi resumen de herramientas de base de conocimiento es el punto de partida práctico.

Qué significa esto si vas a poner IA en una cola de soporte

Un modelo es un motor, no un coche. Esa distinción es todo el argumento de agentes de IA frente a chatbots, y por eso una tabla de benchmarks te dice tan poco sobre una cola.

La brecha entre "esto puntúa bien en benchmarks" y "esto responde a mis clientes" es el producto entero, y está formada en su mayoría por partes poco glamurosas:

  • Grounding (anclaje). El modelo necesita leer tu centro de ayuda, tus macros y tus tickets resueltos, no sus datos de entrenamiento. Ese es el trabajo de una capa de chatbot de base de conocimiento con IA.
  • Enrutamiento por confianza. Algo tiene que decidir cuándo el modelo no debería responder en absoluto, que es el núcleo de la gestión de escalado con IA.
  • Una prueba en seco (dry run). Quieres conocer la tasa de resolución antes que los clientes, no después. Simular contra tu propio historial de tickets es la única forma honesta de obtener esa cifra.
  • Traspaso (handoff). Cuando la IA se detiene, una persona retoma la conversación a mitad de camino con todo el contexto, según las mejores prácticas de traspaso. La versión más suave de esto es un copiloto de IA, donde el modelo redacta y una persona envía.
  • Medición. La tasa de desviación (deflection rate) es el número que decide si todo esto funcionó. Tradúcelo a dinero con el coste por resolución.
  • Cobertura. Saber qué temas debería asumir la IA siquiera es un ejercicio propio, explicado en esta guía de desviación de tickets.

Una responsable de CX de suplementos de una marca DTC con la que hablé resumió el requisito en una frase: "Necesito una IA que solo maneje los tickets en los que confía y que deje todos los demás en paz". Ningún checkpoint de modelo te da eso. Un umbral de confianza y una regla de enrutamiento sí, dentro de cualquier sistema de tickets con IA que ya uses.

El lado de las métricas de esa decisión vale la pena leerlo por separado, porque "resuelto" significa cosas distintas para cada equipo. Empieza con las métricas de soporte, y luego con la resolución en el primer contacto.

Esa es también la respuesta a la pregunta de construir frente a comprar que un checkpoint gratuito con licencia Apache 2.0 plantea de forma natural. Los pesos son la parte más barata del proyecto. Los $0.50 por millón de tokens de entrada son la parte más barata del proyecto. Las partes caras son el pipeline de recuperación, el arnés de evaluación, la lógica de escalado y la persona que mantiene las tres cosas el próximo trimestre.

El panel de control del helpdesk de eesel AI, mostrando respuestas redactadas por IA y enrutamiento por confianza sobre una cola de tickets en vivo
El panel de control del helpdesk de eesel AI, mostrando respuestas redactadas por IA y enrutamiento por confianza sobre una cola de tickets en vivo

¿Quieres usar un modelo así en tickets reales?

Si el precio y la velocidad de Inkling-Small te llamaron la atención, lo que realmente quieres es esa economía envuelta en barreras de seguridad. eesel se conecta a Zendesk, Freshdesk y el resto de tu pila, se entrena con tus tickets pasados y tu centro de ayuda en lugar de con la memoria de un modelo, y te permite simular todo el proceso contra tu historial de tickets antes de que un solo cliente lo vea. Tú fijas el umbral de confianza; todo lo que quede por debajo va a una persona con el contexto adjunto. Gratis para probar, y verás tu propia tasa de resolución antes de comprometerte.

Try eesel

Cómo se compara con las demás opciones de pesos abiertos

El nivel de pesos abiertos está abarrotado y las diferencias son más estrechas de lo que sugieren los artículos de lanzamiento.

Inkling-SmallInkling (padre)DeepSeek V4 Flash
Parámetros276B / 12B activos975B / 41B activostamaño comparable
Entradastexto, imagen, audiotexto, imagen, audiosolo texto
Salida por 1M$1.20$4.05menor
Velocidad131.1 tok/s84.8 tok/smuy rápido
AA Intelligence Index40 (#15)41 (#13)ver reseña

La lectura de la comunidad fue breve y razonablemente acertada. El hilo principal de Hacker News atrajo solo 33 puntos y dos comentarios, uno de los cuales señaló que es "más o menos del mismo tamaño que DeepSeek Flash 4, pero también admite entrada de audio e imagen". Ese es el diferenciador en una frase: entrada multimodal a precio de modelo pequeño.

El vecino más cercano en precio y forma es DeepSeek V4 Flash, que lo abarata por token pero solo admite texto.

En el otro extremo, Kimi K3 cobra tarifas de frontera por pesos abiertos, lo que hace que los $1.20 de Inkling-Small parezcan generosos en comparación.

Si quieres la versión con veredicto de este artículo en lugar de la explicativa, ahí está la reseña de Inkling-Small. El padre de 975B también tiene su propia explicación de Inkling.

Dos más que vale la pena mirar antes de decidirte: mi reseña de Inkling cubre el problema de precios del modelo padre, y alternativas a Inkling mapea el campo más amplio.

Cifras de seguridad, para completar: StrongREJECT 98.4, FORTRESS 71.6 y 96.9, MMMU Pro 74.0, ARC-AGI-1 84.0, ARC-AGI-2 40.1, SciCode 48.7, CritPt 8.3, AA-Briefcase 917, GDPval-AA v2 1269 frente a 1238 del padre.

Mi valoración

Inkling-Small es el más interesante de los dos lanzamientos de Inkling, y lo digo como alguien a quien no le impresionó el precio del primero. Es más rápido y cuesta aproximadamente un tercio de un modelo al que en su mayoría supera, acepta audio e imágenes, y con 89 GB cuantizado es el primer modelo de esta clase que un equipo pequeño puede poseer por completo.

Las advertencias son específicas, no vagas. Lee el techo de contexto real de tu proveedor en lugar del de la ficha. Presupuesta la entrada a $0.50. Y no lo trates como fuente de conocimiento, porque una puntuación de Omniscience de -9.0 es el modelo diciéndote, de antemano, que se equivocará con confianza.

Para cualquier cosa de cara al cliente, el modelo es la decisión fácil. La capa de automatización que lo rodea es la que determina si funciona, y eso sigue siendo cierto sin importar qué checkpoint gane el próximo mes.

Si este artículo te ha hecho considerar un despliegue en lugar de una descarga, empieza con la desviación de tier-1. Luego averigua dónde el modelo no debería responder en absoluto, que es el trabajo del triaje de tickets.

Fuentes

  • Ficha del modelo de Thinking Machines Lab, thinkingmachines/Inkling-Small en Hugging Face (arquitectura, tabla de benchmarks, guía de hardware, ajustes de muestreo)
  • Artificial Analysis (Intelligence Index, rendimiento, TTFT, precios combinados, Omniscience)
  • Página del modelo y API de OpenRouter (ventana de contexto servida, precio de entrada, número de proveedores)
  • Tamaños de las builds cuantizadas de Unsloth
  • Hilo de lanzamiento en Hacker News
  • eesel Customer Voice Dossier (GENERAL BYTES, con permiso; extractos anonimizados de soporte técnico B2B y de suplementos DTC)

Preguntas frecuentes

¿Qué es Inkling-Small?
Inkling-Small es el segundo modelo de pesos abiertos de Thinking Machines Lab, lanzado el 30 de julio de 2026 bajo licencia Apache 2.0. Es un modelo Mixture-of-Experts con 276B de parámetros totales y 12B activos por token, así que cuesta ejecutarlo como un modelo de 12B mientras conserva el conocimiento de uno de 276B. Recibe texto, imágenes y audio, y produce texto. Es el hermano pequeño de Inkling, que tiene 975B totales / 41B activos.
¿Inkling-Small es gratis y de código abierto?
Los pesos son Apache 2.0, así que puedes descargarlos, ajustarlos (fine-tuning) y lanzarlos comercialmente sin pagar licencia. Pero pesos gratuitos no significa inferencia gratuita: la build cuantizada más pequeña utilizable pesa unos 89 GB, y los pesos completos en BF16 llegan a 543 GB. Si prefieres no tener ese hardware, hay dos proveedores alojados que lo sirven. Más opciones en mi resumen de los mejores agentes de IA de código abierto.
¿Cuánto cuesta Inkling-Small?
La salida cuesta $1.20 por 1M de tokens, en lo que todas las fuentes coinciden. La entrada es donde se vuelve confuso: Artificial Analysis indica $0.30, la página del modelo en OpenRouter dice $0.45, y la propia API de OpenRouter devuelve $0.50. Presupuesta contra $0.50 y no te llevarás sorpresas. Para lo que eso significa en economía de soporte, más que de desarrollo, revisa el coste de la atención al cliente con IA.
¿Cuál es la ventana de contexto de Inkling-Small?
La ficha del modelo dice 1M de tokens. OpenRouter lo sirve a 524.288, justo la mitad. Ambas cifras son reales, solo describen cosas distintas: lo que soporta la arquitectura frente a lo que un proveedor ha decidido alojar. Comprueba el límite del endpoint que realmente usas antes de diseñar en torno a él. La misma brecha atrapa a la gente con los agentes de codificación, algo que traté en la ventana de contexto de Claude Code.
¿Puedo ejecutar Inkling-Small localmente?
Sí, si tienes la memoria. Las builds cuantizadas de Unsloth van desde 543 GB en BF16 hasta 89 GB en 2-bit, y esa cifra de 89 GB es la que hace viable una estación de trabajo con 128 GB de memoria unificada. La propia ficha de Thinking Machines pide al menos 600 GB de VRAM para BF16 y 180 GB para NVFP4. El soporte en llama.cpp requiere tener fusionado el PR #25731 en tu build.
¿Es Inkling-Small bueno para atención al cliente?
Es un excelente ejecutor y una pobre enciclopedia. SimpleQA Verified cae a 20.6% desde el 43.9% de su modelo padre, y su puntuación de Omniscience en Artificial Analysis es de -9.0, lo que significa que da respuestas incorrectas con más confianza que respuestas correctas. Envuélvelo con recuperación (retrieval) y enrutamiento por confianza y funciona bien. Apúntalo directo a una cola de tickets y obtienes el patrón de fallo descrito en la prevención de alucinaciones de IA.
¿Cómo se compara Inkling-Small con DeepSeek V4 Flash y Kimi K3?
Está en el mismo nivel de pesos abiertos y las contrapartidas varían según el trabajo. DeepSeek V4 Flash es más barato por token y solo texto; Kimi K3 tiene precios de frontera. El diferenciador de Inkling-Small es la entrada nativa de audio e imagen a precio de modelo pequeño. Un comentarista de Hacker News lo resumió así: "Más o menos del mismo tamaño que DeepSeek Flash 4, pero también admite entrada de audio e imagen".
¿Qué hardware necesita Inkling-Small?
Para los pesos completos en BF16, Thinking Machines sugiere 4x B300 u 8x H200. NVFP4 necesita al menos 180 GB. Cuantizado, la escala es de 132-170 GB en 4-bit, 128 GB en 3-bit y 89 GB en 2-bit. Si no tienes nada de eso a mano, la API alojada es la vía práctica, y las cuentas de construir frente a comprar están en modelos de IA personalizados.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab
Trending

Inkling explicado: el modelo de IA de pesos abiertos de Thinking Machines

Qué es realmente Inkling: el primer modelo de pesos abiertos de Thinking Machines Lab, sus benchmarks reales, cuánto cuesta ejecutarlo y si tiene algo que hacer cerca de una cola de soporte.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustración que compara un núcleo de modelo pequeño y ordenado con otro mucho mayor y enmarañado, para un análisis de Inkling-Small
Trending

Análisis de Inkling-Small: un cuarto del tamaño, y casi igual de listo

Un análisis práctico de Inkling-Small: supera a su propio modelo padre de 975B en programación con un cuarto del tamaño y un cuarto del precio, y luego se desploma en factualidad. Esto es lo que ese intercambio realmente te cuesta.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab analizado en este artículo
Trending

Análisis de Inkling: ¿vale la pena el modelo abierto de Thinking Machines?

Un análisis honesto de Inkling: en qué es realmente bueno el primer modelo de pesos abiertos de Thinking Machines Lab, dónde fallan el precio y los benchmarks, y quién debería usarlo realmente.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustración editorial que representa una comparación de modelos de IA como alternativas a Inkling
Trending

8 mejores alternativas a Inkling en 2026

Inkling es abierto e interesante, pero es caro para ser de pesos abiertos y no es el modelo más inteligente que puedes usar. Aquí tienes las 8 alternativas que realmente probaría, con precios reales y en qué gana cada una.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustración de un modelo de control de robots humanoides, que representa a Gemini Robotics 2
Trending

Gemini Robotics 2: lo que muestran las cifras de DeepMind

Gemini Robotics 2 lanza tres modelos y una tabla de éxito por tarea en la que la mayoría de las puntuaciones no llega al 80%. Esa tabla es lo más útil de todo el lanzamiento.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustración de un modelo que genera paneles de imagen, vídeo y audio, en representación de FLUX 3 de Black Forest Labs
Trending

FLUX 3: lo que Black Forest Labs realmente lanzó

FLUX 3 es un solo modelo para imagen, video, audio y acciones de robots. Tampoco tiene API, ni precio, ni pesos abiertos todavía. Esto es lo que puedes y no puedes conseguir.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración de paneles de imagen, video y documentos alimentando un modelo de visión y lenguaje, con el logo de Qwen
Trending

Qwen 3.7 Flash: especificaciones, precios y qué hace realmente

Qwen 3.7 Flash se lanzó sin entrada de blog, sin benchmarks y sin pesos. Aquí está la hoja de especificaciones completa, los precios escalonados y lo que Qwen nunca afirmó.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Illustration comparing a heavyweight reasoning model against a fast balanced model on cost and capability
Trending

Claude Opus 5 vs Sonnet 5: ¿cuál deberías usar?

Claude Opus 5 cuesta 1.7x lo que Sonnet 5 por token y aun así termina algunos trabajos más barato. Aquí va el cara a cara sobre precio, benchmarks y coste real por tarea.

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026
Illustration of a developer at a laptop watching an agentic coding loop run through code, checks and a bot
Trending

Reseña de Claude Opus 5: programación casi de nivel frontera a mitad de precio

Una reseña práctica de Claude Opus 5: lo que realmente dicen los benchmarks, la tasa de alucinaciones que subió, y si tiene sentido en una cola de soporte en producción.

Alicia Kirana UtomoAlicia Kirana UtomoJul 27, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis