Gemini Robotics 2: lo que muestran las cifras de DeepMind

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edición August 6, 2026

Verificado por expertos
Ilustración de un modelo de control de robots humanoides, que representa a Gemini Robotics 2

Qué es realmente Gemini Robotics 2

El humanoide Apptronik Apollo 2 alcanzando una caja azul con tela sobre una mesa de trabajo mientras tres investigadores observan detrás de sus portátiles, tomada de Google DeepMind
El humanoide Apptronik Apollo 2 alcanzando una caja azul con tela sobre una mesa de trabajo mientras tres investigadores observan detrás de sus portátiles, tomada de Google DeepMind

El nombre no le hace ningún favor a nadie aquí, así que vamos con la versión sencilla. «Gemini Robotics 2» es el nombre de la familia y también el nombre de un modelo específico dentro de esa familia. Tres modelos se lanzaron juntos el mismo día, y cada uno hace un trabajo distinto.

Diagrama de los tres modelos de Gemini Robotics 2 en una pila vertical: ER 2, el planificador, en la parte superior, cede el control de motores al VLA en el medio, que a su vez cede el control a On-Device 2, que se ejecuta sin conexión en la parte inferior
Diagrama de los tres modelos de Gemini Robotics 2 en una pila vertical: ER 2, el planificador, en la parte superior, cede el control de motores al VLA en el medio, que a su vez cede el control a On-Device 2, que se ejecuta sin conexión en la parte inferior

Esta división importa, porque es la misma arquitectura que yo dibujaría para cualquier sistema de agentes serio. Un modelo razona sobre qué hacer, y hace seguimiento de si funcionó. Una pieza separada, más rápida, se encarga de ejecutar. DeepMind es explícito en que ER 2 «cede la ejecución de motores a cualquier modelo de visión-lenguaje-acción (VLA) de nivel inferior dado», es decir, el planificador se mantiene deliberadamente agnóstico respecto a las manos.

ModeloTrabajoEstadoCómo conseguirlo
Gemini Robotics 2 (VLA)Convierte visión y lenguaje en control de motores, de los pies a las puntas de los dedosVista previa privadaSolo mediante el formulario de Trusted Tester
Gemini Robotics ER 2Planifica tareas de varios pasos, habla con humanos, hace seguimiento del progresoVista previa públicaAPI de Gemini y Google AI Studio, autoservicio
Gemini Robotics On-Device 2El mismo trabajo de VLA, ejecutado localmente sin redTesters de confianzaFormulario de lista de espera

Un detalle en la documentación replantea todo el asunto: ER 2 está construido sobre Gemini 3.5 Flash. No es una derivada de nivel Pro. Tampoco es una arquitectura hecha a medida. Es un modelo de clase Flash, con razonamiento espacial, localización de momentos en vídeo y orquestación multi-robot ajustados encima. Cualquiera que haya seguido Gemini 3.6 Flash ya sabe más o menos cómo es el presupuesto de cómputo subyacente, y la línea Flash-Lite cuenta la misma historia.

El trabajo de señalar y de coordenadas viene del mismo linaje que la visión agéntica de Gemini. Y si estás valorando toda la familia, mantengo actualizada una lista de alternativas a Gemini.

La afirmación de control de cuerpo completo es real, y merece la pena aclararla. Las versiones anteriores solo controlaban la parte superior del cuerpo del humanoide, para trabajo de mesa. Esta también controla las piernas. El prompt de demo que publicó DeepMind es «pon la regadera en el contenedor verde de la balda de abajo», y el Apollo 2 de Apptronik camina hasta la mesa, recoge la regadera, se desplaza hasta las estanterías y la coloca. El mismo checkpoint del modelo también mueve un Franka Duo equipado con pinzas de dos dedos, que es la parte más discretamente impresionante de todo esto.

Las cifras que DeepMind publicó sobre sí mismo

Aquí está la tabla completa, exactamente como la reportó DeepMind. Los tres grupos de habilidades corren sobre un mismo checkpoint compartido, en tres cuerpos de robot distintos, y por eso la dispersión aquí resulta interesante en lugar de vergonzosa.

Grupo de habilidadesRobot y manosTareaTasa de éxito
Manipulación de cuerpo completoApollo 2 con manos InspireRecoger de una estantería76.3%
Manipulación de cuerpo completoApollo 2 con manos InspireRecoger de una mesa68.4%
Manipulación de cuerpo completoApollo 2 con manos InspireRecoger del suelo45.7%
Destreza con varios dedosApollo 2 con manos SharpaWaveDesenroscar bombilla92%
Destreza con varios dedosApollo 2 con manos SharpaWaveAtar bolsa de basura44%
Destreza con varios dedosApollo 2 con manos SharpaWaveCerrar bolsa ziplock40%
Destreza con varios dedosApollo 2 con manos SharpaWaveEnroscar bombilla36%
Destreza con varios dedosApollo 2 con manos SharpaWaveRecogedor32%
Destreza con pinzaFranka Duo con pinza RobotiqInserción de precisión89.6%
Destreza con pinzaFranka Duo con pinza RobotiqPreparación de kits de herramientas variadas78.9%
Destreza con pinzaFranka Duo con pinza RobotiqRecoger y colocar general74.2%

Lee juntos el extremo superior y el inferior del grupo de varios dedos, porque ese único par cuenta toda la historia de dónde está el aprendizaje robótico en 2026. Desenroscar una bombilla es 92%. Enroscar una es 36%. Ambas usan la misma mano SharpaWave de cinco dedos y 22 grados de libertad, en el mismo robot. Lo que cambia es el movimiento. Desenroscar es holgado y perdona errores; enroscar exige mantener una alineación mientras aplicas torsión. Uno es agarrar. El otro es un problema de control.

El grupo de pinza supera al grupo de manos en casi todo, y ese es el segundo dato que merece la pena detenerse a considerar. Una pinza Robotiq de dos dedos en el Franka Duo logra un 89,6% en inserción de precisión, mientras que la mano antropomórfica solo logra un 40% con una bolsa ziplock. Más grados de libertad compraron peores resultados en el trabajo fino. Al menos por ahora.

Y DeepMind lo dijo ella misma. El pie del gráfico dice: «Aunque Gemini Robotics 2 logra una tasa de éxito media a alta en tareas de destreza de cuerpo completo y basadas en pinza, la manipulación destra con varios dedos sigue siendo un reto». En otra parte de esa misma página: «nuestros robots tienen más margen de avance en velocidad de movimiento», y la destreza a nivel humano se plantea como un objetivo, no como una afirmación.

Por qué una sola cifra combinada habría escondido todo esto

Promedia esas cinco tareas de varios dedos en una sola cifra y acabas en algún punto de la mitad de los cuarenta, sin haber aprendido nada. No sabrías que el modelo está casi resuelto en un movimiento y apenas funcional en otro. Tampoco sabrías en torno a qué tarea evitar diseñar tu producto.

Diagrama de antes y después: una barra alta con la etiqueta «una sola puntuación titular» que dice «parece correcto», luego una flecha con la etiqueta «desglosarlo» que lleva a cinco barras descendentes etiquetadas desenroscar, atar bolsa, ziplock, enroscar y recogedor, con una línea discontinua que marca el promedio
Diagrama de antes y después: una barra alta con la etiqueta «una sola puntuación titular» que dice «parece correcto», luego una flecha con la etiqueta «desglosarlo» que lleva a cinco barras descendentes etiquetadas desenroscar, atar bolsa, ziplock, enroscar y recogedor, con una línea discontinua que marca el promedio

Esto no es en absoluto un problema de robótica. Es el estado por defecto del marketing de IA en cualquier categoría, la mía incluida, donde una sola cifra de desvío de nivel 1 esconde exactamente la misma dispersión. Muévete tú mismo las cifras y observa qué fácil es dirigir el titular:

Prueba "Solo las 4 favorables" y sale una cifra que cualquier equipo de marketing imprimiría con gusto. Mismo modelo, mismo día, mismo laboratorio. No se fabricó absolutamente nada para producirla. Ese es el truco, y está disponible para cualquier proveedor que reporte una sola cifra.

El dato más interesante trata sobre humanos, no sobre robots

Enterrada en los benchmarks de ER 2 hay una comparación que DeepMind ejecuta de tres formas. Mide qué tan bien el modelo de razonamiento dirige a un ejecutor posterior, y lo que cambia es ese ejecutor: primero un robot real, luego uno simulado, luego un teleoperador humano.

Modo de controlGemini Robotics ER 1.6Gemini Robotics ER 2
Controlando teleoperación humana63.6%74.0%
Controlando VLA real48.6%60.0%
Controlando VLA simulado37.4%42.9%

El mismo planificador es 14 puntos mejor dirigiendo a una persona que dirigiendo a un robot. El modelo no es peor en uno de los dos casos. El humano al otro lado simplemente absorbe la ambigüedad, se recupera de un mal agarre, rellena cualquier intención que la instrucción dejó fuera.

Diagrama que muestra una caja etiquetada «mismo planificador, mismo cerebro» dividiéndose en dos carriles: dirigiendo a un ayudante humano al 74,0% y dirigiendo un brazo robótico al 60,0%, con una llave que marca una diferencia de 14 puntos
Diagrama que muestra una caja etiquetada «mismo planificador, mismo cerebro» dividiéndose en dos carriles: dirigiendo a un ayudante humano al 74,0% y dirigiendo un brazo robótico al 60,0%, con una llave que marca una diferencia de 14 puntos

Un comentarista de Reddit que veía las imágenes de la demo llegó a la misma conclusión desde fuera:

Reddit

"The bottleneck seems to be software. So until we get ai good enough to pilot a robot, it's going to remain slow.

If you see robots piloted by humans, they are much faster."

Este es el hallazgo que pegaría en una pared, y en realidad no es un hallazgo de robótica. Es el argumento del copiloto de IA con una cifra adjunta. Un modelo que planifica y luego cede el control a un humano capaz supera al mismo modelo manejando el efector final por sí solo, y la diferencia es medible. En trabajo de soporte, esa es la diferencia entre un agente que redacta una respuesta para que alguien la envíe, frente a un agente que responde por su cuenta. La respuesta honesta sobre cuál rinde mejor es la misma que la de DeepMind, es la que tiene una persona en el bucle, hasta que las cifras por tarea digan otra cosa.

Nada de esto es un argumento contra la autonomía. Es un argumento a favor de conocer la cifra antes de elegir, y esa cifra se mueve rápido, tan rápido que los mejores agentes de IA de hace seis meses no son los que elegirías hoy.

El resto del conjunto de comparación de ER 2 es sólido, y merece la pena reportarlo de forma justa:

MétricaOpus 5GPT 5.6 SolER 1.6Gemini 3.6 FlashER 2
Respuesta a preguntas (ERQA)67.2%43.2%72.5%73.0%78.5%
Detección de éxito (imagen)83.6%83.1%82.9%83.3%87.7%
Detección de éxito (vídeo)81.0%74.7%76.0%75.4%82.4%
Lectura generalizada de instrumentos53.0%61.5%52.8%52.0%65.7%
Clasificación de progreso37.1%46.2%42.7%43.9%57.4%

La clasificación de progreso es el margen más amplio de toda la página: 57,4% frente al 46,2% del mejor modelo no robótico. La métrica es «puedes decir hasta dónde has llegado en una tarea», puntuada por fotograma en cinco categorías. Poco glamurosa, y es exactamente lo que un agente necesita saber antes de decidir si sigue adelante o pide ayuda. DeepMind también reporta un 91,3% de precisión en la localización de momentos, con una distancia media absoluta de 0,96 segundos, a 4 veces la velocidad de ejecución de las categorías de modelos más grandes.

También vale la pena señalar que ese mismo 57,4% significa que se equivoca sobre el progreso más o menos cuatro de cada diez veces. Lo mejor de su clase, y aun así se equivoca con esa frecuencia, lo cual es un estado normal en este campo. Es también exactamente el tipo de cosa que una afirmación de una línea sobre «estado del arte» borra.

El salto en seguridad del que nadie habla

Esta es la cifra que me hizo incorporarme de golpe. No la he visto todavía cubierta en ningún sitio.

Métrica de seguridadOpus 5GPT 5.6 SolER 1.6ER 2
Seguimiento de instrucciones de seguridad95.9%91.4%47.2%97.9%
Proximidad humana (1 m)77.1%83.4%51.1%93.0%

Gemini Robotics ER 1.6 seguía las instrucciones de seguridad el 47,2% de las veces. Ese modelo se lanzó en abril de 2026, es decir, hace cuatro meses, y quedó por debajo tanto de Opus 5 como de GPT 5.6 Sol en ambas métricas de seguridad. Un modelo ajustado para robótica, peor en seguridad robótica que los modelos de texto de uso general contra los que se le comparó.

ER 2 lo arregla a fondo, hasta el 97,9% y el 93,0%. Bien. Sin embargo, la lectura útil es lo que la cifra de la generación anterior dice sobre confiar en una etiqueta de versión. «El último modelo de robótica de un laboratorio puntero» era, hasta la semana pasada, algo que seguía una restricción de seguridad menos de la mitad de las veces. DeepMind también lanzó un nuevo benchmark para esto, ASIMOV-Agentic, publicado como conjunto de datos público. Mide si el agente de razonamiento rechazará una llamada a herramienta insegura, si puede predecir que una tarea es imposible, y luego si pide ayuda a un humano cuando no está seguro.

Rechazar, predecir el fallo, escalar cuando hay incertidumbre. Eso describe mejor a un agente de soporte bien construido que la mayoría de la documentación de IA de soporte, y se traslada directamente a la gestión de escalamiento. El traspaso es una disciplina propia por encima de eso, y el traspaso de chat es el caso que la mayoría de los equipos hacen mal primero.

Merece la pena ser preciso sobre los límites aquí. El blog afirma que ER 2 es el modelo de robótica más seguro de DeepMind hasta la fecha, pero no publica ninguna puntuación numérica de los resultados de ASIMOV-Agentic en sí. Esos están en un informe técnico de seguridad separado. Y la documentación para desarrolladores es tajante sobre dónde cae la responsabilidad: «es tu responsabilidad mantener un entorno seguro alrededor del robot».

Lo que cuesta, y las trampas de la documentación

Solo ER 2 tiene un precio. Los dos modelos que tocan hardware no tienen ninguno en absoluto, por la simple razón de que no se pueden comprar.

Conceptogemini-robotics-er-2-previewER 1.6 (se retira)
Entrada, por 1M de tokens2,00 $ (texto, imagen, vídeo, audio)1,00 $, más 2,00 $ audio
Salida, por 1M de tokens10,00 $ (incluye tokens de razonamiento)5,00 $
Nivel Batch1,00 $ entrada / 5,00 $ salidano publicado
Caché de contexto0,20 $, más 1,00 $ por 1M de tokens por hora de almacenamientono publicado
Nivel gratuitoGratis, pero las entradas entrenan los productos de GoogleGratis
Ventana de contexto131.072 entrada / 65.536 salida131.072 entrada / 65.536 salida
Límites de tasa publicadosningunoninguno

El precio se duplicó. ER 2 cuesta 2 veces lo que ER 1.6 tanto en entrada como en salida, aunque la tarifa plana de entrada implica que el trabajo con mucho audio ve una subida relativa menor que el trabajo con visión. La ventana de contexto no creció en absoluto. También hay un hermano de streaming, gemini-robotics-er-2-streaming-preview, a la misma tarifa titular, sin nivel Batch ni caché.

Cuatro cosas en la documentación que te costarán una tarde si no las lees primero:

  1. Una clave de API sin restricciones recibe un 403 rotundo. Robótica es la única superficie de Gemini que rechaza una clave por defecto, así que añade restricciones en AI Studio antes de tu primera llamada.
  2. El endpoint de streaming limita la entrada de imagen a JPEG, 1 fotograma por segundo. Lo cual resulta extraño frente a todo el discurso de tiempo real. Un robot que transmite fotogramas de cámara a no más de uno por segundo.
  3. El endpoint de streaming elimina las salidas estructuradas y la ejecución de código. Así que la ruta de esquema JSON pertenece al modelo sin streaming, y la ruta de visión agéntica también.
  4. La documentación recomienda un nivel de razonamiento medium para la latencia, y el ejemplo de introducción viene con high. Cópialo y pégalo, y heredas el valor por defecto lento.

También hay un aviso de privacidad adjunto a estos modelos que ninguna página normal de Gemini lleva. Como los modelos «aprovechan datos de vídeo y audio para operar y mover tu hardware», Google exige que no permitas que haya personas identificables presentes alrededor del robot hasta que hayan sido notificadas y hayan dado su consentimiento, y además pide difuminado de rostros. Pon eso junto al «se usa para mejorar nuestros productos: sí» del nivel gratuito. Un robot de nivel gratuito con una cámara apuntando a personas se convierte entonces en un problema de consentimiento, no de cuota.

Y una nota de calendario que merece la pena anotar: gemini-robotics-er-1.6-preview se apaga el 31 de agosto de 2026. ER 1.5 ya se retiró en abril. Así que, dos endpoints retirados en un año, y todo el código de modelo actual todavía lleva el sufijo -preview sin ningún alias estable al que fijarse.

Adaptación a robots nuevos, y la parte multi-robot

Gemini Robotics On-Device 2 es la pieza que encuentro más silenciosamente significativa. Se ejecuta localmente, hereda el trabajo de transferencia de movimiento de Gemini Robotics 1.5, y se adapta a un robot bi-brazo completamente nuevo «con solo unas pocas horas de tiempo de adaptación, típicamente con menos de 200 ejemplos». Formas nuevas, sensores nuevos, grados de libertad que no coinciden.

Cuadrícula de seis paneles de robots realizando tareas autónomas a distintas velocidades: un robot bi-brazo colocando libros en una estantería, un brazo Trossen moviendo una pieza de ajedrez, un brazo haciendo clic en una casilla «soy un robot» en un monitor, un robot apilando platos en un estante, una escena de cocina cenital, y una pinza naranja clasificando piezas en una bandeja, tomada de Google DeepMind
Cuadrícula de seis paneles de robots realizando tareas autónomas a distintas velocidades: un robot bi-brazo colocando libros en una estantería, un brazo Trossen moviendo una pieza de ajedrez, un brazo haciendo clic en una casilla «soy un robot» en un monitor, un robot apilando platos en un estante, una escena de cocina cenital, y una pinza naranja clasificando piezas en una bandeja, tomada de Google DeepMind

Menos de 200 demostraciones para poner en marcha un nuevo cuerpo de robot, esa es la cifra que cambia la economía del campo. Las tareas de esa cuadrícula corrieron en plataformas Dexmate, SO101 y Trossen, ninguna de ellas el humanoide insignia. Un panel muestra un brazo robótico haciendo clic en una casilla «soy un robot», que asumo es una broma, y que aprecio.

La colaboración multi-robot es la otra capacidad nueva. Robots que se comunican, reconocen las fortalezas físicas del otro, y luego se delegan tareas entre sí. En la demo, un humanoide Apollo 2 trabaja junto a un brazo Franka, con un monitor que muestra lo que ve el modelo.

El humanoide Apollo 2 de pie junto a un robot Franka de doble brazo en una mesa de trabajo con una caja gris, un monitor a la derecha que muestra la vista de la cámara del robot, tomada de Google DeepMind
El humanoide Apollo 2 de pie junto a un robot Franka de doble brazo en una mesa de trabajo con una caja gris, un monitor a la derecha que muestra la vista de la cámara del robot, tomada de Google DeepMind

DeepMind agradeció a Apptronik, Boston Dynamics y Agile Robots como socios, y en una demo aparte, un Spot de Boston Dynamics va a buscar palomitas mediante APIs de Spot orquestadas. En el lado del hardware: Apptronik levantó una Serie A-X de 520 millones de $ en febrero de 2026, lo que lleva su total a cerca de 1.000 millones de $. Merece la pena señalar que Apollo 2 es una plataforma de recolección de datos, no la unidad comercial. La comercial es Apollo 3, y no tiene fecha anunciada. Sin especificaciones publicadas y sin precio publicado, de ninguno de los cuatro proveedores de hardware involucrados.

Lo que dijeron realmente los profesionales

El hilo de Hacker News llegó a 619 puntos y 553 comentarios, y es mejor lectura que cualquiera de las coberturas. El comentario más útil ahí vino de alguien que trabaja en estos modelos:

Hacker News

"Plus we have no good reliable accuracy testing data in most cases (most tests occur on a few demos, but that isn't a good representation of how must things work), popular benchmarks, such as libero have been saturated, and nearly everything gets 95% there, most companies and researchers have their own benchmarks here."

Benchmarks saturados, y todo el mundo calificando su propia tarea. Eso describe también la evaluación de IA de software, casi palabra por palabra, y es por lo que la propia guía de evaluación de OpenAI se apoya tanto en construir tu propio conjunto de evaluación en lugar de confiar en una clasificación pública.

La crítica más aguda no trata sobre el modelo en absoluto. Trata sobre la gramática del vídeo:

Reddit

"This is why we need long continuous shots of robots interacting doing tasks, rather than the sizzle reels with 5 second shots. The long shots tell the true story of how far along the technology is, while the short shots make it look way more advanced than it really is. Still, great to see the progress being made."

Un comentarista de HN fue más allá, calificando las demos de «pick and place glorificado con bajas tasas de éxito en un robot innecesariamente complejo», y diciendo que preferiría las imágenes abiertamente teleoperadas de un competidor, porque se acercaban más a un despliegue real. Duro. Tampoco irrazonable, dado el 45,7%.

Esa cifra del 36% se recogió después como evidencia de un argumento más amplio:

Hacker News

"A 36% success rate on screwing in a light bulb means there's probably something to LeCunn's take that VLM/VLA models aren't going to be the thing powering tomorrow's robots, but only time will tell."

La mejor réplica llegó en una línea, y es la que yo apostaría:

Hacker News

"It's still very early days. There are many benchmarks that LLMs scored 36% on just 18 months ago that they're now at 100% on."

Y luego un roboticista, explicando por qué «lento y cuidadoso» es una clase de problema distinta a «rápido y fluido»:

Hacker News

"An algorithm to fold tshirts 90% of the time is easy. The cloth hangs down by gravity and you can just look for right angles (corners), find their coordinates with binocular matching, and move them to meet each other. Getting 99%, or folding them quickly, so that the fabric is actually moving instead of just hanging still- incredibly, incredibly more complex."

También hubo una buena dosis de «¿no lo había mostrado ya Figure?» ahí dentro, lo cual me lleva a la comparación que realmente importa.

Nadie más publica esta tabla

Fui a buscar las cifras equivalentes por tarea de todos los demás laboratorios de este espacio. Esto es lo público, todo ello.

LaboratorioÚltimo modelo nombrado¿Publica tasas de éxito por tarea?
Google DeepMindGemini Robotics 2, 30 Jul 2026Sí, 11 cifras absolutas en la página de lanzamiento
Physical Intelligenceπ0.7, 16 Apr 2026Parcialmente, relativo a una línea base, valores renderizados en el cliente
FigureHelix 02, 27 Jan 2026No, cero porcentajes de éxito; las tareas son solo en vídeo
Teslaninguno nombradoNo
UnitreeUnifoLM-VLA-0, código abiertoNo, nada evaluativo

DeepMind es el único que puso tasas de fallo absolutas por tarea en su propia página de lanzamiento. Figure nombra tareas de destreza y muestra una carrera de cuatro minutos con un lavavajillas en vídeo, sin adjuntar ninguna cifra a nada de eso. Tesla nunca ha nombrado un modelo de Optimus, en absoluto. Physical Intelligence sí grafica tasas por tarea, pero frente a una línea base de un especialista en RL, y con los valores renderizados en el cliente en lugar de declarados.

Así que la lectura honesta de Gemini Robotics 2 no es «el robot de Google va por detrás». Google es el único que te muestra dónde está realmente su robot, y luego recibe críticas por las cifras que decidió divulgar. Ese es un mal incentivo. Si se mantiene, el siguiente laboratorio simplemente publicará vídeos.

Qué significa esto si estás comprando agentes de IA

Yo no trabajo con robots. Construyo agentes de IA que gestionan tickets de soporte, y este lanzamiento sí cambió lo que creo que un proveedor debería estar obligado a mostrarme.

Hubo un cliente, un equipo danés de B2B de telemática vehicular que gestionaba unos 200 tickets al mes en Zendesk y escalaba hacia 2.000, cuyo agente empezó a decirle con confianza a los clientes «sí, damos soporte a su modelo de coche» para marcas que no estaban en su base de datos. La base de conocimiento decía «damos soporte a todos los modelos». El bot se lo creyó. Su propio resumen de esa configuración inicial fue «ensayo y error al principio». Ese tipo de ticket habría marcado un cero rotundo en una tabla por tarea, y en la cifra combinada era simplemente invisible. Esta es la forma de fallo habitual en la automatización del servicio al cliente, nada exótico, y por eso la prevención de alucinaciones es más una cuestión de configuración que de modelo.

Por eso cada despliegue de eesel corre primero una simulación contra el propio historial de tickets del cliente. Se toma un lote de tickets resueltos, se genera lo que sea que el agente habría dicho, se compara eso con lo que el humano realmente envió, se puntúa, y luego se produce un informe de brechas antes de que intervenga un solo cliente real. Es la tabla de DeepMind, solo que construida a partir de tus tickets en lugar de bombillas. Una responsable de CX en una marca de suplementos D2C planteó el requisito mejor de lo que yo podría:

"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Tres cosas que me llevaría de este lanzamiento a cualquier compra de agente de IA, física o no:

  1. Pide la tabla por tarea, no el titular. Cuando un proveedor cita una sola cifra de desvío, pide que se desglose por intención o por tipo de ticket. La verdad está en la dispersión, y las métricas de rendimiento de IA solo son útiles a ese nivel de detalle. Lo mismo aplica a la resolución en el primer contacto.
  2. Prueba con tu propio historial antes de lanzar. Un benchmark ejecutado sobre las tareas de otra persona no predice nada sobre los casos límite de tu política de reembolsos. El mismo instinto que las pruebas adversarias, y la razón por la que evaluar agentes es mejor que confiar en una demo.
  3. Diseña para la tarea del 32%, no para la del 92%. Sabe qué trabajo debería rechazar el agente. Fija umbrales de confianza de forma deliberada, mantén el traspaso limpio. Prevenir una respuesta equivocada dicha con confianza vale más que un punto de cobertura.

Ese último punto es todo el juego. Un agente que resuelve el 60% de los tickets y luego escala limpiamente el resto es un mejor producto que uno que intenta el 100% y se equivoca en uno de cada cinco, y los clientes me lo dicen constantemente. Las matemáticas del coste por resolución también salen mejor, una vez que incorporas el precio de los tickets que crea una mala respuesta.

Si quieres el panorama de medición más completo, mi artículo sobre evaluación del servicio al cliente profundiza más de lo que puedo aquí, y también la comparación de coste de agente frente a humano. Y si todavía estás eligiendo un modelo base, qué LLM conviene al soporte es una mejor pregunta de partida que cualquier benchmark de robótica.

Prueba eesel

Si estás buscando un software de atención al cliente agéntico, y quieres la honestidad por tarea que este artículo lleva defendiendo, eso es más o menos para lo que se construyó eesel. Se conecta a Zendesk o a cualquier helpdesk que ya uses, Freshdesk incluido. Aprende de tus macros y de tus tickets pasados. Luego ejecuta una simulación sobre tu historial real, así que puedes ver la forma de su precisión por tipo de ticket antes de que responda nunca a un cliente.

La vista de informes de eesel para un agente de Zendesk, mostrando el volumen de tareas en 30 días, eventos disparadores por tipo, y recuentos de aprobación o rechazo por herramienta
La vista de informes de eesel para un agente de Zendesk, mostrando el volumen de tareas en 30 días, eventos disparadores por tipo, y recuentos de aprobación o rechazo por herramienta

La diferencia concreta: decides tú qué tipos de ticket toca y cuáles deja en paz, y obtienes recuentos de aprobación y rechazo por acción en lugar de un solo porcentaje de desvío. Gridwise vio resuelto el 73% de las solicitudes de nivel 1 en el primer mes, y sabía cuáles eran el 27% que no. El precio es por ticket, así que no estás comprando plazas para un agente que solo gestiona una porción de la cola.

Prueba eesel gratis, o simplemente apúntalo a cien de tus tickets antiguos y mira qué dice el informe de brechas.

Preguntas frecuentes

¿Qué es Gemini Robotics 2?
Gemini Robotics 2 es la familia de modelos de robótica de Google DeepMind, anunciada el 30 de julio de 2026. Son tres modelos, no uno: un modelo de visión-lenguaje-acción que controla los motores del robot, un modelo de razonamiento corporeizado llamado Gemini Robotics ER 2 que planifica la tarea, y una versión on-device que se ejecuta localmente. Solo ER 2 está disponible para el público. Se sitúa en la misma línea que Gemini 3.6 Flash y Gemini 3.5 Pro en el lado de texto.
¿Cuánto cuesta Gemini Robotics 2?
Solo el modelo de razonamiento tiene precio publicado. gemini-robotics-er-2-preview cuesta 2,00 $ por millón de tokens de entrada y 10,00 $ por millón de tokens de salida, con un nivel Batch a la mitad de precio. Eso duplica la tarifa de ER 1.6. El modelo de visión-lenguaje-acción y el modelo on-device no tienen ningún precio publicado, ya que solo están disponibles por lista de espera. Si en cambio presupuestas el gasto en IA en función de resultados, el coste por resolución es el marco más útil.
¿Cuál es la tasa de éxito de Gemini Robotics 2 en tareas reales?
DeepMind publicó once cifras por tarea. La más alta es 92% para desenroscar una bombilla y 89,6% para inserción de precisión; las más bajas son 32% para barrer con un recogedor y 36% para volver a enroscar una bombilla. Recoger un objeto del suelo es 45,7%. DeepMind afirma en el pie de su propio gráfico que la manipulación destra con varios dedos sigue siendo un reto. Ese tipo de divulgación por tarea es justo lo que deberían ser las métricas de rendimiento de IA en todas partes.
¿Puedo usar Gemini Robotics 2 sin un robot?
Sí, en parte. Gemini Robotics ER 2 es un modelo de visión y lenguaje que recibe texto, imagen, vídeo y audio, y devuelve texto, así que puedes apuntarlo a una imagen en Google AI Studio y obtener coordenadas de objetos o un plan de tareas sin ningún hardware. El modelo que realmente mueve los motores es el que no puedes conseguir. Para trabajos no físicos, elegir el LLM adecuado importa más que el ajuste robótico.
¿Es seguro desplegar Gemini Robotics 2 cerca de personas?
La propia documentación de Google traslada esa responsabilidad al usuario: dice que es tu responsabilidad mantener un entorno seguro alrededor del robot. ER 2 obtiene un 97,9% en seguimiento de instrucciones de seguridad, frente al 47,2% de ER 1.6, y existe un aviso de privacidad específico para robótica que exige el consentimiento de cualquier persona presente en la zona, además de difuminado de rostros. El mismo principio se aplica en software, por lo que los umbrales de confianza y unas reglas claras de traspaso importan antes de poner en marcha cualquier agente.
¿Cómo se compara Gemini Robotics 2 con Figure o Physical Intelligence?
En materia de transparencia no hay comparación posible. La página de Helix 02 de Figure no publica ningún porcentaje de éxito, Tesla nunca ha nombrado un modelo de Optimus, y Unitree publica UnifoLM-VLA-0 como código abierto sin nada evaluativo adjunto. Physical Intelligence sí grafica tasas por tarea, pero solo frente a una línea base, con los valores renderizados en el cliente. DeepMind es el único que pone en su propia página de lanzamiento tasas de fallo absolutas por tarea. Consulta también mi lista de alternativas a Gemini.
¿Qué pasó con Gemini Robotics ER 1.6?
Se está retirando. La página de obsolescencias de Google indica que gemini-robotics-er-1.6-preview se lanzó el 14 de abril de 2026 y se apagará el 31 de agosto de 2026, con ER 2 como sustituto recomendado, y ER 1.5 ya se retiró en abril. La migración es solo cambiar la cadena del modelo. Dos endpoints retirados en un año es algo que vale la pena tener en cuenta en cualquier hoja de ruta, del mismo modo que sopesarías las pruebas adversarias antes de confiar en un lanzamiento nuevo.
¿Qué significa Gemini Robotics 2 para la IA en atención al cliente?
La lección que se puede trasladar es sobre medición, no sobre robots. DeepMind reporta el éxito por tarea, así que puedes ver un 92% y un 32% dentro del mismo modelo, mientras que la mayoría de los proveedores de IA de soporte reportan una sola cifra de desvío combinada. Pide en su lugar el desglose por intención, y prueba primero con tu propio historial. Esa es toda la idea detrás de un software de atención al cliente agéntico que puedes simular antes de lanzarlo, y es mejor que fiarte de una sola cifra del marketing de desvío de tickets de nivel 1.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Banner de Gemini 3.5 Flash-Lite sobre un fondo azul Google
Trending

Gemini 3.5 Flash-Lite: qué es, precio y para quién es

Gemini 3.5 Flash-Lite es el modelo 3.5 más rápido y barato de Google, a $0,30/$2,50 por 1M de tokens. Aquí te explico qué es, cuánto cuesta y cuándo usarlo.

Rama Adi NugrahaRama Adi NugrahaJul 22, 2026
Banner principal de precios de Gemini 3.6 Flash sobre un fondo azul de Google
Trending

Precios de Gemini 3.6 Flash: el desglose completo de costes para 2026

Gemini 3.6 Flash cuesta $1.50 de entrada y $7.50 de salida por 1M de tokens. Aquí tienes la tabla de precios completa, los costes ocultos y lo que realmente cuesta usarlo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Banner de Gemini 3.6 Flash sobre un fondo azul de Google
Trending

Gemini 3.6 Flash: qué es, qué cuesta y para quién es

Gemini 3.6 Flash es el nuevo modelo de trabajo de Google: 17% menos tokens de salida, salida más barata y un contexto de 1M. Esto es lo que es y quién debería usarlo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Gemini 3.5 Flash Cyber hero banner on a Google-blue background
Trending

Gemini 3.5 Flash Cyber: qué es y quién puede usarlo

Gemini 3.5 Flash Cyber es el modelo de seguridad de Google para encontrar y corregir vulnerabilidades de código. Esto es lo que hace, cómo lo usa CodeMender y por qué probablemente todavía no puedas acceder a él.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Banner principal de precios de Gemini 3.5 Flash-Lite sobre fondo azul de Google
Trending

Precios de Gemini 3.5 Flash-Lite: qué cuesta y para quién es

Gemini 3.5 Flash-Lite es el modelo más barato de Google, a $0.30/$2.50 por 1M de tokens. Aquí tienes la tabla de precios completa, un ejemplo de coste real y para quién es.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Ilustración de un chip de modelo compacto que enruta un token por dos rutas de expertos iluminadas entre muchas apagadas, para una explicación de Inkling-Small
Trending

Inkling-Small explicado: un modelo de 276B con 12B activos

Qué es realmente Inkling-Small: un MoE de pesos abiertos de 276B/12B de Thinking Machines, la ventana de contexto en la que la documentación y los proveedores no coinciden, lo que realmente cuesta un millón de tokens y dónde encaja en una pila de soporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración que compara un núcleo de modelo pequeño y ordenado con otro mucho mayor y enmarañado, para un análisis de Inkling-Small
Trending

Análisis de Inkling-Small: un cuarto del tamaño, y casi igual de listo

Un análisis práctico de Inkling-Small: supera a su propio modelo padre de 975B en programación con un cuarto del tamaño y un cuarto del precio, y luego se desploma en factualidad. Esto es lo que ese intercambio realmente te cuesta.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustración de un modelo que genera paneles de imagen, vídeo y audio, en representación de FLUX 3 de Black Forest Labs
Trending

FLUX 3: lo que Black Forest Labs realmente lanzó

FLUX 3 es un solo modelo para imagen, video, audio y acciones de robots. Tampoco tiene API, ni precio, ni pesos abiertos todavía. Esto es lo que puedes y no puedes conseguir.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración de paneles de imagen, video y documentos alimentando un modelo de visión y lenguaje, con el logo de Qwen
Trending

Qwen 3.7 Flash: especificaciones, precios y qué hace realmente

Qwen 3.7 Flash se lanzó sin entrada de blog, sin benchmarks y sin pesos. Aquí está la hoja de especificaciones completa, los precios escalonados y lo que Qwen nunca afirmó.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis