Inkling-Small explicado: un modelo de 276B en el que 12B hacen el trabajo

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edición August 4, 2026

Verificado por expertos
Ilustración de un chip de modelo compacto que encamina un token por dos rutas de expertos iluminadas entre muchas apagadas, para un artículo explicativo sobre Inkling-Small

Qué es realmente Inkling-Small

Thinking Machines Lab es la empresa de Mira Murati, y su modelo de negocio consiste en regalar los pesos y vender las herramientas alrededor. Inkling-Small es el segundo modelo que sale a la calle: Apache 2.0, publicado en Hugging Face como thinkingmachines/Inkling-Small, y descargado unas 15.500 veces en su primer mes.

El proveedor lo llama "un cuarto del tamaño" del original, y por una vez la cifra de marketing se sostiene. El padre tiene 975B totales / 41B activos en 66 capas. Este tiene 276B totales / 12B activos en 42 capas. Eso está realmente cerca de un cuarto en ambos aspectos.

Ilustración del enrutamiento mixture-of-experts en Inkling-Small, mostrando 6 de muchos expertos iluminados más 2 expertos compartidos, con 276B totales y 12B activos por token
Ilustración del enrutamiento mixture-of-experts en Inkling-Small, mostrando 6 de muchos expertos iluminados más 2 expertos compartidos, con 276B totales y 12B activos por token

La arquitectura es un Mixture-of-Experts bastante agresivo. Cada capa contiene 256 expertos, y el enrutador elige 6 de ellos por token, más 2 expertos compartidos que siempre están activos. La atención es híbrida, alternando capas locales y globales, y los pesos se distribuyen tanto en BF16 como en NVFP4. El entrenamiento se ejecutó en hardware NVIDIA GB300 NVL72.

La consecuencia práctica de esta forma: pagas 276B en memoria y 12B en cómputo. Ese es todo el truco, y por eso un modelo con un cuarto de billón de parámetros puede servir más rápido que un modelo denso de una décima parte de su tamaño. Si el vocabulario de MoE es nuevo para ti, la mecánica se generaliza a la mayoría de los agentes de IA de código abierto actuales.

También hay un dial de esfuerzo de razonamiento que va de 0 a 0,99, con los puntos sugeridos por el proveedor en 0,2 para bajo, 0,7 para medio y 0,99 para máximo. Es un control sobre cuánto tiempo piensa el modelo antes de responder, y mueve tu factura de tokens más que cualquier otro ajuste que toques.

Qué entra, y qué sale

Esta es la parte que la gente entiende peor con más frecuencia, así que vale la pena ser directo.

Diagrama que muestra a Inkling-Small aceptando entrada de texto, imagen y audio pero produciendo solo salida de texto, sin síntesis de voz
Diagrama que muestra a Inkling-Small aceptando entrada de texto, imagen y audio pero produciendo solo salida de texto, sin síntesis de voz

Las entradas son texto, imágenes entre 40 y 4096 píxeles, y audio como WAV de 16kHz de menos de dos minutos. La salida es solo texto. No hay síntesis de voz en este modelo.

Eso importa si estabas planeando una línea telefónica. Un modelo que oye audio pero no puede hablar es solo la mitad de un pipeline de voz, y aún necesitas texto a voz, telefonía, gestión de barge-in y detección de turnos por encima. Si ese es el proyecto, el panorama de proveedores en empresas de voz con IA es un mejor punto de partida que un modelo en crudo.

La comprensión de audio es también la única capacidad en la que el modelo pequeño perdió terreno frente a su padre en todos los frentes: VoiceBench 90,1 frente a 91,4, Audio MC 54,9 frente a 56,6, MMAU 77,0 frente a 77,2. Las brechas son pequeñas, pero todas apuntan en la misma dirección.

La ventana de contexto en la que nadie se pone de acuerdo

Aquí hay un hallazgo verificable que llevó dos minutos y ahorra una tarde entera.

La ficha del modelo dice que la ventana de contexto es de 1M de tokens. OpenRouter, uno de los únicos dos proveedores que lo ofrecen, lo aloja a 524.288 tokens. Eso es exactamente la mitad, lo que indica que es una decisión de alojamiento deliberada y no una errata.

Ninguna de las dos cifras es mentira. Una describe lo que la arquitectura puede direccionar, la otra describe lo que un endpoint concreto aceptará hoy. El patrón de fallo es diseñar un pipeline de relleno de documentos contra la cifra de la ficha y chocar con un muro en producción. Si estás construyendo algo que se apoya en una ventana larga, lee el límite en el endpoint que realmente estás llamando. La misma trampa atrapa a la gente que usa agentes de codificación, por lo que escribí sobre el tamaño de la ventana de contexto por separado.

El número de proveedores es el otro punto débil: 2 proveedores, frente a 4 del modelo padre. Para un modelo que va cinco días en su segunda semana, es de esperar, pero significa menos margen para fallar sin quedarse sin servicio.

Cuánto cuesta

El precio de la salida está asentado. 1,20 $ por 1M de tokens de salida, confirmado por el proveedor, Artificial Analysis y OpenRouter. Frente a los 4,05 $ del padre, ese es el titular.

El precio de la entrada no está asentado, y prefiero decírtelo así que elegir una cifra y parecer seguro:

FuenteEntrada por 1MSalida por 1M
Artificial Analysis0,30 $1,20 $
Página del modelo en OpenRouter0,45 $1,20 $
Respuesta de la API de OpenRouter0,50 $1,20 $
Modelo padre (Inkling)referencia4,05 $

Presupuesta contra 0,50 $ y nada te sorprenderá. En base combinada, Artificial Analysis sitúa a Inkling-Small en 0,22 $ por 1M frente a 0,72 $ del padre, así que aproximadamente un tercio del coste para el mismo nivel de inteligencia.

La velocidad es la mitad menos valorada del trato. 131,1 tokens de salida por segundo frente a los 84,8 del padre, con un tiempo hasta el primer token de 1,65 s frente a 1,82 s. En su Intelligence Index, el modelo pequeño puntúa 40 y se clasifica 15º de 101, frente a 41 y 13º del padre. Mismo nivel, más rápido, más barato. Es una combinación inusual y la razón principal para prestarle atención a este lanzamiento.

El ajuste fino se ejecuta a través de la propia plataforma Tinker de Thinking Machines, que soporta el modelo. Las tarifas de entrenamiento por token no están publicadas en ningún sitio que haya podido encontrar, y la página de precios en tinker-docs.thinkingmachines.ai/pricing actualmente devuelve un 404. El almacenamiento de checkpoints cuesta 0,10 $ por GB al mes. Si el ajuste fino es el plan, el compromiso frente a la recuperación (retrieval) está explicado en RAG versus fine-tuning.

Ejecutarlo tú mismo

Aquí es donde se pone a prueba lo "gratis" de los pesos gratuitos. Las compilaciones cuantizadas de Unsloth ponen cifras reales sobre esto, y la cifra de 2 bits es la interesante: 89 GB, que encaja en una caja de 128 GB de memoria unificada.

Hay un detalle bonito en la discusión de lanzamiento. Un comentarista de Hacker News, andy99, dijo que esperaba algo alrededor de 90 GB antes de que se publicara ninguna cuantización. Unsloth aterrizó en 89.

Comprobación de ajuste para autoalojamiento
¿Qué encaja realmente en tu hardware?
Elige la máquina que tienes. Las cifras son de las compilaciones cuantizadas de Unsloth más la propia ficha de Thinking Machines.
2 bits encaja, en 89 GB
Encaja: 2 bits (89 GB)
Justo en el límite: 3 bits (128 GB)
Demasiado grande: 4 bits (132-170 GB), NVFP4 (180 GB+), BF16 (543 GB)
Este es el resultado destacado del lanzamiento: un modelo de un cuarto de billón de parámetros en una sola máquina de escritorio. Espera pérdida de calidad en 2 bits, y pruébalo con tus propios prompts en vez de confiar en los benchmarks.
3 bits encaja, 4 bits no del todo
Encaja: 2 bits (89 GB), 3 bits (128 GB)
Demasiado grande: 4 bits empieza en 132 GB, NVFP4 (180 GB+), BF16 (543 GB)
Frustrantemente cerca. El extremo inferior de 4 bits es 132 GB frente a tus 141 GB de VRAM en crudo, y la caché KV para un contexto largo se come la diferencia.
NVFP4 encaja, y 4 bits también, con holgura
Encaja: NVFP4 (180 GB+ requeridos), 4 bits (132-170 GB), 3 bits, 2 bits
Demasiado grande: BF16 (543 GB)
Este es el punto óptimo para servir. NVFP4 es aquí un formato de primera clase publicado por el propio proveedor, no una conversión de la comunidad, así que es el que conviene usar.
Los pesos completos en BF16 encajan
Encaja: BF16 (543 GB), y todo lo de abajo
Sugerencia de la ficha: 4x B300 u 8x H200 para BF16
Si tienes tanto silicio ya conoces la respuesta. Cabe notar que el modelo padre necesita alrededor de 2 TB en BF16, así que el pequeño es el primero de los dos que encaja en un solo nodo.
Usa la API alojada
Salida: 1,20 $ por 1M de tokens
Entrada: 0,30 $ a 0,50 $ por 1M, según la fuente
Proveedores: 2 hoy
A estas tarifas necesitarías mucho volumen antes de que poseer hardware valga la pena, y el número de dos proveedores significa un failover limitado. Ajustes de muestreo: temperatura 1,0, top_p 1,0, min_p 0,0.

Dos notas de mantenimiento si vas a lo local. El muestreo debería ser temperatura 1,0, top_p 1,0, min_p 0,0, lo cual es lo bastante inusual como para merecer anotarlo. Y el soporte de llama.cpp llegó vía el PR #25731, así que comprueba que tu build lo incluya antes de depurar problemas fantasma.

Dónde encaja, y dónde realmente no

En la propia tabla comparativa de su fabricante, el modelo pequeño supera a su padre de 975B en la mayoría de lo que llamarías ejecución. SWEBench Verified 80,2 frente a 77,6, SWEBench Pro 55,9 frente a 54,3, Terminal Bench 2.1 en 64,7 frente a 63,8, Toolathlon 54,4 frente a 45,5, MCP Atlas 79,6 frente a 76,0, GPQA 89,5 frente a 87,2, IFBench 82,2 frente a 79,8.

Luego está la otra columna. AIME baja a 95,5 desde 97,1. Global-MMLU-Lite cae a 86,7 desde 88,7, lo que vale la pena señalar si estabas planeando un agente de soporte multilingüe sobre él. Y Tau 3 Banking cae a 15,5 desde 23,7, la regresión individual más pronunciada de la hoja, en un benchmark específicamente sobre uso de herramientas en múltiples turnos en un entorno de cara al cliente.

El par que más importa para cualquiera que piense en trabajo de soporte es SimpleQA Verified en 20,6% frente al 43,9% del padre, junto con una puntuación de Omniscience de -9,0 frente a +2,1 del padre. Una puntuación de Omniscience negativa significa que el modelo se equivoca con más confianza de la que tiene razón. Nadie en los hilos de lanzamiento lo mencionó, lo cual es una pena, porque es el número más relevante para la decisión en todo el lanzamiento.

Quiero ser justo aquí, porque esto es una decisión de diseño y no un defecto. Un modelo con 12B activos tiene menos espacio para memorizar el mundo que uno con 41B activos, y Thinking Machines claramente gastó ese espacio en razonamiento y uso de herramientas en su lugar. Si tu modelo va a buscar información de todos modos, el trivial memorizado es peso muerto. Esa es la apuesta correcta para un agente.

Es la apuesta equivocada para un bot que responde preguntas de memoria. Esta es exactamente la forma de fallo que he visto ocurrir en vivo. Un equipo de soporte técnico B2B con el que trabajé descubrió que su bot confirmaba "sí, soportamos su modelo de vehículo" para vehículos que no estaban en su base de datos, porque el centro de ayuda decía que la empresa soportaba todos los modelos. El modelo no estaba roto. Estaba haciendo inferencia confiada sobre una fuente vaga, que es lo que predice una puntuación de Omniscience negativa. Escribí el patrón completo en prevención de alucinaciones.

Así que la lectura honesta: usa Inkling-Small donde una capa de recuperación suministre los hechos y el modelo suministre el razonamiento. No lo uses como fuente de verdad.

Lo que significa que la calidad de tus fuentes se convierte en el límite de la precisión del modelo, y elegirlas bien es una palanca mayor que elegir el checkpoint. Mi repaso de herramientas de base de conocimiento es el punto de partida práctico.

Qué significa esto si vas a poner IA en una cola de soporte

Un modelo es un motor, no un coche. Esa distinción es el núcleo de agentes de IA frente a chatbots, y por eso una tabla de benchmarks te dice tan poco sobre una cola.

La brecha entre "esto puntúa bien en benchmarks" y "esto responde a mis clientes" es el producto entero, y está formada en su mayoría por partes poco glamurosas:

  • Fundamentación (grounding). El modelo necesita leer tu centro de ayuda, tus macros y tus tickets resueltos, no sus datos de entrenamiento. Ese es el trabajo de una capa como un chatbot de base de conocimiento con IA.
  • Enrutamiento por confianza. Algo tiene que decidir cuándo el modelo no debería responder en absoluto, que es el núcleo de la gestión de escalado con IA.
  • Un ensayo (dry run). Quieres conocer la tasa de resolución antes de que la conozcan los clientes, no después. La simulación contra tu propio historial de tickets es la única forma honesta de obtener esa cifra.
  • Traspaso (handoff). Cuando la IA se detiene, un humano continúa la conversación con contexto completo, según las mejores prácticas de traspaso. La versión más suave de esto es un copiloto de IA, donde el modelo redacta y un humano envía.
  • Medición. La tasa de desvío (deflection) es la cifra que decide si todo esto funcionó. Tradúcela a dinero con el coste por resolución.
  • Cobertura. Saber qué temas debería asumir la IA en absoluto es su propio ejercicio, explicado en esta guía de desvío de tickets.

Una responsable de CX de suplementos DTC con la que hablé formuló el requisito en una frase: "I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone." Ningún checkpoint de modelo te da eso. Un umbral de confianza y una regla de enrutamiento sí, dentro de cualquier sistema de tickets con IA que ya uses.

El lado de las métricas de esta decisión merece leerse por separado, porque "resuelto" significa cosas distintas para equipos distintos. Empieza con métricas de soporte, luego resolución en el primer contacto.

Esa es también la respuesta a la pregunta de construir versus comprar que un checkpoint gratuito Apache 2.0 plantea de forma natural. Los pesos son la parte más barata del proyecto. Los 0,50 $ por millón de tokens de entrada son la parte más barata del proyecto. Las partes caras son el pipeline de recuperación, el arnés de evaluación, la lógica de escalado y la persona que mantiene las tres el próximo trimestre.

El panel de control del helpdesk de eesel AI, mostrando respuestas redactadas por IA y enrutamiento por confianza sobre una cola de tickets en vivo
El panel de control del helpdesk de eesel AI, mostrando respuestas redactadas por IA y enrutamiento por confianza sobre una cola de tickets en vivo

¿Quieres usar un modelo así en tickets reales?

Si el precio y la velocidad de Inkling-Small te llamaron la atención, lo que realmente quieres es esa economía envuelta en barreras de seguridad. eesel se conecta a Zendesk, Freshdesk y el resto de tu stack, entrena con tus tickets pasados y tu centro de ayuda en lugar de con la memoria de un modelo, y te deja simular todo el proceso contra tu historial de tickets antes de que un solo cliente lo vea. Tú fijas el umbral de confianza; todo lo que quede por debajo va a un humano con contexto adjunto. Gratis para probar, y verás tu propia tasa de resolución antes de comprometerte.

Probar eesel

Cómo se compara con las otras opciones de pesos abiertos

El nivel de pesos abiertos está abarrotado y las diferencias son más estrechas de lo que sugieren los posts de lanzamiento.

Inkling-SmallInkling (padre)DeepSeek V4 Flash
Parámetros276B / 12B activos975B / 41B activostamaño comparable
Entradastexto, imagen, audiotexto, imagen, audiosolo texto
Salida por 1M1,20 $4,05 $menor
Velocidad131,1 tok/s84,8 tok/smuy rápida
AA Intelligence Index40 (#15)41 (#13)ver review

La lectura de la comunidad fue corta y razonablemente acertada. El hilo principal de Hacker News atrajo solo 33 puntos y dos comentarios, uno de los cuales señaló que es "About the same size as DeepSeek Flash 4, but also supports audio and image input." Ese es el diferenciador en una línea: entrada multimodal a precio de modelo pequeño.

El vecino más cercano en precio y forma es DeepSeek V4 Flash, que lo supera en precio por token pero solo acepta texto.

En el otro extremo del rango, Kimi K3 cobra tarifas de frontera por pesos abiertos, lo que hace que los 1,20 $ de Inkling-Small parezcan generosos en comparación.

Si quieres la versión en forma de veredicto de este artículo en lugar de la explicativa, esa es la review de Inkling-Small. El padre de 975B tiene también su propio artículo explicativo de Inkling.

Otros dos que vale la pena revisar antes de decidir: mi review de Inkling cubre el problema de precios del padre, y alternativas a Inkling mapea el campo más amplio.

Cifras de seguridad, para completar: StrongREJECT 98,4, FORTRESS 71,6 y 96,9, MMMU Pro 74,0, ARC-AGI-1 84,0, ARC-AGI-2 40,1, SciCode 48,7, CritPt 8,3, AA-Briefcase 917, GDPval-AA v2 1269 frente a 1238 del padre.

Mi conclusión

Inkling-Small es el más interesante de los dos lanzamientos de Inkling, y lo digo como alguien que quedó poco impresionado con el precio del primero. Es más rápido y cuesta aproximadamente un tercio de un modelo al que en su mayoría supera, acepta audio e imágenes, y con 89 GB cuantizado es el primer modelo de esta clase que un equipo pequeño puede poseer por completo.

Las salvedades son específicas, no vagas. Lee el límite de contexto real de tu proveedor en lugar del de la ficha. Presupuesta la entrada a 0,50 $. Y no lo trates como fuente de conocimiento, porque una puntuación de Omniscience de -9,0 te está diciendo, por adelantado, que se equivocará con confianza.

Para cualquier cosa de cara al cliente, el modelo es la decisión fácil. La capa de automatización alrededor de él es la que determina si funciona, y eso sigue siendo cierto sea cual sea el checkpoint que gane el mes que viene.

Si este artículo te tiene sopesando un despliegue en lugar de una descarga, empieza con desvío de tier 1. Luego resuelve dónde el modelo no debería responder en absoluto, que es el trabajo del triaje de tickets.

Fuentes

  • Ficha del modelo de Thinking Machines Lab, thinkingmachines/Inkling-Small en Hugging Face (arquitectura, tabla de benchmarks, recomendaciones de hardware, ajustes de muestreo)
  • Artificial Analysis (Intelligence Index, rendimiento, TTFT, precios combinados, Omniscience)
  • Página del modelo y API de OpenRouter (ventana de contexto servida, precios de entrada, número de proveedores)
  • Tamaños de las compilaciones cuantizadas de Unsloth
  • Hilo de lanzamiento en Hacker News
  • eesel Customer Voice Dossier (GENERAL BYTES, con permiso; extractos anonimizados de soporte técnico B2B y de suplementos DTC)

Preguntas frecuentes

¿Qué es Inkling-Small?
Inkling-Small es el segundo modelo de pesos abiertos de Thinking Machines Lab, lanzado el 30 de julio de 2026 bajo Apache 2.0. Es un modelo Mixture-of-Experts con 276B de parámetros totales y 12B activos por token, así que cuesta ejecutarlo aproximadamente como un modelo de 12B mientras lleva el conocimiento de uno de 276B. Recibe texto, imágenes y audio, y produce texto. Es el hermano menor de Inkling, que tiene 975B totales / 41B activos.
¿Inkling-Small es gratuito y de código abierto?
Los pesos son Apache 2.0, así que puedes descargarlos, ajustarlos (fine-tuning) y lanzarlos comercialmente sin cuota de licencia. Pero pesos gratuitos no significan inferencia gratuita: la compilación cuantizada más pequeña utilizable pesa unos 89 GB, y los pesos completos en BF16 son 543 GB. Si prefieres no tener ese hardware, dos proveedores alojados lo ofrecen. Hay más opciones en mi repaso de los mejores agentes de IA de código abierto.
¿Cuánto cuesta Inkling-Small?
La salida cuesta 1,20 $ por 1M de tokens, en lo que todas las fuentes coinciden. La entrada es donde se enturbia: Artificial Analysis indica 0,30 $, la página del modelo en OpenRouter dice 0,45 $, y la propia API de OpenRouter devuelve 0,50 $. Presupuesta contra 0,50 $ y no te sorprenderás. Para lo que eso significa en la economía del soporte, más que en la del desarrollo, mira AI customer service cost.
¿Cuál es la ventana de contexto de Inkling-Small?
La ficha del modelo dice 1M de tokens. OpenRouter lo sirve a 524.288, exactamente la mitad. Ambas cifras son reales, solo describen cosas distintas: lo que la arquitectura soporta frente a lo que un proveedor ha decidido alojar. Comprueba el límite del endpoint que realmente uses antes de diseñar en torno a él. La misma brecha atrapa a la gente con los agentes de codificación, algo que cubrí en la ventana de contexto de Claude Code.
¿Puedo ejecutar Inkling-Small localmente?
Sí, si tienes la memoria necesaria. Las compilaciones cuantizadas de Unsloth van desde 543 GB en BF16 hasta 89 GB en 2 bits, y esa cifra de 89 GB es lo que hace viable una estación de trabajo con 128 GB de memoria unificada. La propia ficha de Thinking Machines pide al menos 600 GB de VRAM para BF16 y 180 GB para NVFP4. El soporte en llama.cpp requiere tener el PR #25731 integrado en tu build.
¿Es Inkling-Small bueno para atención al cliente?
Es un excelente ejecutor y una mala enciclopedia. SimpleQA Verified cae a 20,6% desde el 43,9% de su modelo padre, y su puntuación de Omniscience en Artificial Analysis es -9,0, lo que significa que da más respuestas incorrectas con confianza que correctas. Envuélvelo con recuperación (retrieval) y enrutamiento por confianza, y va bien. Apúntalo en crudo a una cola de tickets y obtienes el patrón de fallo descrito en AI hallucination prevention.
¿Cómo se compara Inkling-Small con DeepSeek V4 Flash y Kimi K3?
Está en el mismo nivel de pesos abiertos, y las contrapartidas cambian según la tarea. DeepSeek V4 Flash es más barato por token y solo de texto; Kimi K3 tiene precios de frontera. El diferenciador de Inkling-Small es la entrada nativa de audio e imagen a precio de modelo pequeño. Un comentarista de Hacker News lo resumió así: "About the same size as DeepSeek Flash 4, but also supports audio and image input."
¿Qué hardware necesita Inkling-Small?
Para los pesos completos en BF16, Thinking Machines sugiere 4x B300 u 8x H200. NVFP4 necesita al menos 180 GB. Cuantizado, la escala es 132-170 GB en 4 bits, 128 GB en 3 bits y 89 GB en 2 bits. Si nada de eso está en tu mesa, la API alojada es la ruta práctica, y las cuentas de construir versus comprar están en custom AI models.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Ilustración de un chip de modelo compacto que enruta un token por dos rutas de expertos iluminadas entre muchas apagadas, para una explicación de Inkling-Small
Trending

Inkling-Small explicado: un modelo de 276B con 12B activos

Qué es realmente Inkling-Small: un MoE de pesos abiertos de 276B/12B de Thinking Machines, la ventana de contexto en la que la documentación y los proveedores no coinciden, lo que realmente cuesta un millón de tokens y dónde encaja en una pila de soporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab
Trending

Inkling explicado: el modelo de IA de pesos abiertos de Thinking Machines

Qué es realmente Inkling: el primer modelo de pesos abiertos de Thinking Machines Lab, sus benchmarks reales, cuánto cuesta ejecutarlo y si tiene algo que hacer cerca de una cola de soporte.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustración que compara un núcleo de modelo pequeño y ordenado con otro mucho mayor y enmarañado, para un análisis de Inkling-Small
Trending

Análisis de Inkling-Small: un cuarto del tamaño, y casi igual de listo

Un análisis práctico de Inkling-Small: supera a su propio modelo padre de 975B en programación con un cuarto del tamaño y un cuarto del precio, y luego se desploma en factualidad. Esto es lo que ese intercambio realmente te cuesta.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab analizado en este artículo
Trending

Análisis de Inkling: ¿vale la pena el modelo abierto de Thinking Machines?

Un análisis honesto de Inkling: en qué es realmente bueno el primer modelo de pesos abiertos de Thinking Machines Lab, dónde fallan el precio y los benchmarks, y quién debería usarlo realmente.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustración editorial que representa una comparación de modelos de IA como alternativas a Inkling
Trending

8 mejores alternativas a Inkling en 2026

Inkling es abierto e interesante, pero es caro para ser de pesos abiertos y no es el modelo más inteligente que puedes usar. Aquí tienes las 8 alternativas que realmente probaría, con precios reales y en qué gana cada una.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustración del espacio de trabajo super-agente de Skywork AI
Trending

¿Qué es Skywork AI? El espacio de trabajo "super-agente", explicado

Skywork AI es un super-agente de IA de propósito general que crea diapositivas, documentos, hojas de cálculo, sitios web y vídeos. Esto es lo que hace, cómo funciona y cuánto cuesta.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustración de un modelo de control de robots humanoides, que representa a Gemini Robotics 2
Trending

Gemini Robotics 2: lo que muestran las cifras de DeepMind

Gemini Robotics 2 lanza tres modelos y una tabla de éxito por tarea en la que la mayoría de las puntuaciones no llega al 80%. Esa tabla es lo más útil de todo el lanzamiento.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Un agente de IA saliendo de un monitor para operar ventanas de aplicaciones y documentos mientras dos colegas observan, en el color azul de marca de Meta
Trending

Meta Muse Spark 1.1: qué es, cuánto cuesta y dónde falla

La primera API de modelos de pago de Meta lanza un modelo agente con 1M de contexto a $1.25/$4.25. En qué es realmente bueno Muse Spark 1.1, y los benchmarks que Meta dejó fuera de la diapositiva.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Ilustración de un modelo que genera paneles de imagen, vídeo y audio, en representación de FLUX 3 de Black Forest Labs
Trending

FLUX 3: lo que Black Forest Labs realmente lanzó

FLUX 3 es un solo modelo para imagen, video, audio y acciones de robots. Tampoco tiene API, ni precio, ni pesos abiertos todavía. Esto es lo que puedes y no puedes conseguir.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis