Síguenos en Google News

Google presenta Gemini agent, una IA capaz de trabajar durante días y coordinar agentes autónomos

Síguenos en Google News

Google Cloud presentó Gemini agent durante Gemini at Work 2026, un agente de IA que puede trabajar entre distintas aplicaciones desde una misma interfaz. Según la compañía, puede ejecutar tareas durante horas o días y coordinar agentes especializados para completarlas.

Gemini agent combina herramientas, memoria y distintos modelos de IA para ejecutar tareas con permisos y controles de gasto. | Creada con Gemini Notebooks

¿Qué tareas puede realizar Gemini agent?

El usuario le explica qué necesita a la IA y Gemini agent organiza los pasos para completar la tarea, sin recibir instrucciones para cada operación. Para hacerlo, combina las capacidades de un asistente conversacional con herramientas para ejecutar acciones, escribir código y acceder a servicios externos.

Entre las funciones anunciadas por Google se encuentran:

  • Investigación y documentos: consultar información, organizar antecedentes y elaborar documentos a partir de los datos disponibles.
  • Creación de contenido: generar imágenes, materiales multimedia y presentaciones mediante instrucciones en lenguaje natural.
  • Programación: escribir y ejecutar código, además de utilizar herramientas de desarrollo.
  • Automatización: programar actividades y ejecutar acciones cuando ocurren determinados eventos.
  • Trabajo entre aplicaciones: consultar información y completar operaciones utilizando diferentes servicios sin reconstruir las instrucciones originales.
  • Coordinación de agentes: crear subagentes temporales para distribuir actividades que pueden ejecutarse de manera simultánea o secuencial.
El usuario define el objetivo y Gemini agent organiza los pasos, coordina subagentes y ejecuta el trabajo en la nube. | Creada con Gemini Notebooks

Gemini agent sigue trabajando en la nube aunque el usuario cierre el computador o cambie de dispositivo. Según Google, las tareas pueden continuar durante varios días y conservar su estado hasta finalizar.

Según Google, el agente se puede usar desde la web y en iOS, Android, Windows y Mac. También está disponible mediante la línea de comandos, Google Workspace, Microsoft 365 y Slack, y puede integrarse en aplicaciones de terceros sin una interfaz propia.

Memoria persistente y agentes que trabajan como integrantes de un equipo

Gemini agent conserva el contexto de las tareas en curso y reutiliza información de interacciones anteriores. Para ello utiliza cuatro tipos de memoria, que separan el trabajo en ejecución de los conocimientos almacenados, los métodos aprendidos y el historial de actividades.

Google distingue los siguientes componentes:

  • Memoria de sesión: mantiene la información relacionada con una actividad, incluso cuando continúa ejecutándose durante varios días.
  • Memoria semántica: organiza conocimientos obtenidos desde documentos, conversaciones y actividades con otros agentes.
  • Memoria procedimental: conserva instrucciones y métodos de trabajo reutilizables, incluyendo habilidades creadas por el propio sistema.
  • Memoria episódica: registra las actividades realizadas anteriormente para conservar antecedentes sobre su ejecución.

Google también presentó los coworker agents, agentes permanentes que pueden asumir una función dentro de un equipo y recibir solicitudes de distintas personas. Cada uno cuenta con identidad, correo electrónico, calendario y almacenamiento propios, además de permisos independientes de los usuarios que interactúan con él.

En Google Workspace, estos agentes pueden participar en conversaciones de Chat, responder menciones y editar documentos compartidos. Sus cambios aparecen bajo su propio nombre en el historial de versiones, y el acceso queda limitado a la información proporcionada por los integrantes del equipo.

A diferencia de los subagentes temporales, los coworker agents mantienen una función definida y pueden seguir trabajando entre distintas sesiones.

Los subagentes se crean para tareas específicas, mientras que los coworker agents mantienen una función e identidad propias entre sesiones. | Creada con Gemini Notebooks

Integración con Google Workspace y aplicaciones externas

Google plantea un ejemplo: un usuario recibe un correo en el que le solicitan una presentación sobre el estado de un proyecto. Workspace Intelligence puede reconocer esa solicitud como una tarea delegable y ofrecer la opción de asignarla a Gemini.

Gemini agent funciona directamente en Gmail, Drive, Docs, Sheets, Slides, Chat y Calendar, con la misma memoria, herramientas y controles de su interfaz principal. Puede utilizar información de distintas aplicaciones para completar una tarea, sin que el usuario tenga que volver a explicar los antecedentes del proyecto.

Además de las aplicaciones de Google, el sistema admite conexiones con otras herramientas mediante un registro de servicios y conectores:

  • Colaboración: Microsoft Office, Teams, Slack y Confluence.
  • Desarrollo: Git y Jira.
  • Gestión empresarial: Salesforce y ServiceNow.
  • Bases de datos: BigQuery, Databricks, PostgreSQL y Snowflake.
  • Herramientas externas: servidores compatibles con Model Context Protocol (MCP), dentro o fuera de la red corporativa.

Los equipos pueden crear sus propias skills: instrucciones reutilizables que describen cómo realizar tareas de varios pasos y que se pueden publicar en un registro compartido. Gemini selecciona las herramientas y habilidades que necesita para cada operación, conservando el contexto del usuario y sus proyectos.

Gemini también puede utilizar Claude de Anthropic para ejecutar tareas

Google separó Gemini agent de los modelos de inteligencia artificial que procesan sus solicitudes, de modo que una misma tarea puede utilizar distintos modelos. Actualmente contempla modelos Gemini y Claude de Anthropic, y la compañía anunció planes para incorporar otras alternativas privadas y de código abierto.

Smart Routing puede seleccionar automáticamente el modelo para cada solicitud según su rendimiento y costo. Al combinar modelos en un mismo proyecto, el agente conserva sus herramientas, memoria y procedimientos.

Desde Cloud Billing Console se puede fijar un límite de gasto por proyecto, que considera tanto el consumo de tokens como los recursos usados para ejecutar las tareas. Si se alcanza ese presupuesto, el agente suspende el trabajo hasta que se reanude manualmente desde la consola.

Análisis de datos, generación de código y consultas con BigQuery

Las funciones de análisis de datos permiten solicitar tareas de ingeniería de datos, aprendizaje automático e informes mediante instrucciones en lenguaje natural. El agente puede trabajar con datos empresariales, generar código y ejecutar los cálculos con servicios de Google Cloud.

Las principales capacidades incluyen:

  • Ingeniería de datos: generar código PySpark y preparar notebooks para editar y probar los procedimientos.
  • Aprendizaje automático: entrenar modelos e identificar problemas en procesos de datos para intentar corregirlos.
  • Consultas empresariales: generar instrucciones de consulta mediante BigQuery y Knowledge Catalog, utilizando definiciones previamente establecidas.
  • Informes recurrentes: almacenar consultas para ejecutarlas posteriormente sin repetir el procesamiento mediante tokens de IA.
  • Visualización: crear gráficos y paneles de información utilizando las herramientas disponibles para los analistas.

El acceso a los datos también incluye información almacenada en Amazon S3 y Azure Data Lake mediante Borderless Lakehouse, sin tener que trasladarla toda a Google Cloud. El agente puede localizar los conjuntos registrados en Knowledge Catalog y generar instrucciones SQL, Spark o Python para procesarlos.

Google añadió Smart Storage para trabajar con datos no estructurados, como documentos PDF, imágenes y grabaciones de audio. Esta herramienta incorpora información contextual a los objetos almacenados.

Seguridad, permisos y control de las operaciones autónomas

El acceso a documentos, bases de datos y aplicaciones corporativas exige identificar qué agente realiza cada operación y qué recursos puede utilizar. Google asigna identidades individuales a los agentes y utiliza controles de autorización y registros para supervisar su trabajo.

La arquitectura considera cuatro componentes principales:

  • Identidad individual: cada agente dispone de una identidad verificable y permisos propios.
  • Autorización: los administradores establecen restricciones de acceso según las funciones asignadas, incluyendo mecanismos basados en OAuth.
  • Auditoría: las operaciones quedan registradas bajo la identidad del agente que las ejecutó.
  • Aislamiento y comunicaciones: Agent Sandbox proporciona entornos separados para ejecutar código, mientras que Agent Gateway aplica políticas de seguridad al tráfico entrante, saliente y entre agentes.
Agent Sandbox aísla la ejecución y Agent Gateway controla las comunicaciones, con permisos y registros asociados a la identidad de cada agente.

Agent Gateway también permite definir restricciones comunes para todos los agentes de una organización, como impedir el acceso a documentos con determinadas clasificaciones de confidencialidad. Estas políticas se aplican durante la ejecución de las tareas y no dependen de configurar individualmente cada operación.

Google también anunció versiones especializadas de Gemini para servicios financieros y actividades jurídicas, actualmente en vista previa. Adelantó desarrollos para organismos gubernamentales, salud y comercio minorista, aunque no detalló un calendario general para estas especializaciones.

Para Gemini agent, Google no informó fechas de disponibilidad ni precios. Tampoco precisó si se ofrecerá dentro de Gemini Enterprise o como un producto separado.