Ir al contenido
IA para hoy

Tecnología

multimodal

La IA multimodal combina texto, imagen, audio y vídeo en un mismo sistema, permitiendo que un modelo entienda y genere contenido en distintos formatos simultáneamente. Esto habilita asistentes que ven, escuchan y responden de forma natural, y productos que integran generación de imagen, vídeo y comprensión visual en flujos de trabajo cotidianos.

Análisis Qué significa para una empresa

Oportunidades
Permite automatizar edición de imágenes y vídeo, crear asistentes que interpretan contexto visual y de audio (consultas médicas, traducción de lengua de signos, planificación de eventos), y reducir costes operativos mediante procesamiento eficiente de vídeo y generación de contenido creativo integrada en herramientas ofimáticas.
Riesgos
Alta dependencia de proveedores dominantes (principalmente Google y OpenAI), coste variable de tokens según modalidad, y limitaciones persistentes en razonamiento espacial y lógico complejo que pueden generar errores en tareas críticas. También existen dudas regulatorias y de privacidad al procesar datos visuales y de voz sensibles.
Qué debería hacer una empresa
Las empresas deberían evaluar en los próximos 6 meses casos de uso concretos (edición de contenido, atención al cliente, análisis de vídeo) mediante pilotos acotados antes de comprometer integraciones profundas, dado el ritmo de cambio de modelos y precios.

Análisis generado por IA a partir de las noticias disponibles; actualizado hace 50 min.

Relacionadas

LLM ×16agentes ×11video ×4coding ×3RAG ×2imagen ×2voz ×2transformers ×2IA científica ×1generación de código ×1

Historias

Noticias

Sociedad y trabajo

Google DeepMind selecciona 16 proyectos ambientales en Asia-Pacífico para su acelerador de IA

Google DeepMind ha elegido 16 startups, ONG y equipos de investigación de Asia-Pacífico para su primer programa Accelerator: AI for the Planet. Durante tres…

Por qué importaMuestra cómo los grandes laboratorios de IA canalizan modelos especializados hacia sectores de impacto social y ambiental, generando casos de uso…

Impacto bajo Fiabilidad una fuente fiable Google AI

Gemini Spark de Google ya puede gestionar bibliotecas de Google Photos

Google anunció que su agente personal Gemini Spark puede ejecutar tareas en Google Photos, como editar imágenes, curar álbumes, crear álbumes compartidos…

Por qué importaEs un ejemplo más de cómo las grandes tecnológicas integran agentes de IA en servicios de consumo masivo, buscando justificar el valor de las…

Impacto muy bajo Fiabilidad una fuente fiable TechCrunch AI
Modelos y avances 8 fuentes

OpenAI lanza GPT-6 Astra en medio de dudas sobre si ha logrado superinteligencia

OpenAI ha lanzado GPT-6 Astra, descrito como su modelo más potente hasta la fecha. La empresa, que prepara su salida a Bolsa, sugiere haber alcanzado…

Por qué importaUn nuevo modelo de referencia de OpenAI redefine el estado del arte y presiona a competidores y empresas a evaluar su adopción, mientras la narrativa…

Impacto alto Fiabilidad confirmado por varias fuentes El País Tecnología
Modelos y avances 8 fuentes

OpenAI lanza GPT-6 Astra y afirma que podría marcar el inicio de la era AGI

OpenAI anunció el lanzamiento de GPT-6 Astra, que según la compañía es el mejor modelo del mundo para navegar por ordenadores y navegadores web, escribir…

Por qué importaUn modelo capaz de operar interfaces y software como un humano acelera la automatización de tareas administrativas y de oficina, con implicaciones…

Impacto muy alto Fiabilidad confirmado por varias fuentes Wired AI

Playco reduce a la mitad las correcciones manuales al prototipar videojuegos con GPT-6 Astra

Playco utilizó el modelo GPT-6 Astra de OpenAI para construir tres prototipos de videojuegos temáticos a partir de una base 'grey box' común. La compañía…

Por qué importaEs un caso de uso concreto que muestra cómo modelos más avanzados pueden acelerar el desarrollo de videojuegos y reducir trabajo manual repetitivo…

Impacto bajo Fiabilidad una fuente fiable OpenAI

Google recopila sus novedades de IA de agosto: Gemini 3.7 Flash, Pixel 11 y 1.000 millones de usuarios

Google publicó un resumen de sus anuncios de IA de agosto de 2026, incluyendo el modelo Gemini 3.7 Flash para código y agentes a mitad de precio que su…

Por qué importaEs un compendio de anuncios que marca la estrategia de Google de llevar IA más barata y potente a desarrolladores, dispositivos y consumidores…

Impacto medio Fiabilidad una fuente fiable Google AI

Google lanza comprensión agéntica de vídeo para modelos Gemini Flash

Google DeepMind lanzó la comprensión agéntica de vídeo para Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite. La función permite al modelo escanear dinámicamente…

Por qué importaReduce significativamente los costes de procesar vídeos largos, lo que puede desbloquear casos de uso empresariales antes inviables económicamente…

Impacto medio Fiabilidad una fuente fiable Google DeepMind

Google lanza Pics, herramienta de generación y edición de imágenes con IA en Workspace

Google ha lanzado Google Pics, una herramienta de creación y edición de imágenes basada en su modelo Nano Banana, disponible para suscriptores de Google AI Pro…

Por qué importaIntegrar generación y edición de imágenes IA directamente en las herramientas de oficina más usadas reduce fricción y puede acelerar la producción de…

Impacto medio Fiabilidad una fuente fiable Google AI

Google lanza Gemini Omni 1.1 Flash con más control para vídeo generativo

Google DeepMind presentó Gemini Omni 1.1 Flash, un modelo de generación de video para desarrolladores disponible en Google AI Studio y Gemini Enterprise Agent…

Por qué importaMejora sustancialmente el control creativo y la calidad de producción de video generado por IA, acercándolo a usos profesionales reales en lugar de…

Impacto medio Fiabilidad una fuente fiable Google DeepMind

Investigación repasa los tipos de acertijos que aún desafían a los modelos de IA

MIT Technology Review recopila una serie de pruebas y benchmarks (rotación mental, Knights and Knaves, SimpleBench, ARC-AGI, Torre de Hanói, logic grids) donde…

Por qué importaIlustra que el progreso de la IA en benchmarks no es uniforme: sobresale en tareas memorísticas o de patrones conocidos pero falla en razonamiento…

Impacto bajo Fiabilidad una fuente fiable MIT Technology Review

Google DeepMind presenta Gemini 3.7 Flash con mejoras en código y agentes

Google DeepMind ha lanzado Gemini 3.7 Flash, una versión mejorada de su modelo de código abierto Gemini 3.6 Flash, apenas tres semanas después de su…

Por qué importaPara desarrolladores y empresas que construyen agentes y herramientas de automatización, un modelo más preciso en código, razonamiento y ejecución de…

Impacto alto Fiabilidad fuente primaria Google DeepMind

Google DeepMind lanza SL2T, modelo de traducción lengua de signos a texto

Google DeepMind ha presentado SL2T (sign-language-to-text), un modelo de traducción de lenguaje de signos a texto entrenado con más de 100.000 horas de datos…

Por qué importaRepresenta el primer despliegue a escala de consumidor de IA aplicada a lenguas de signos, eliminando una brecha tecnológica histórica entre usuarios…

Impacto alto Fiabilidad fuente primaria Google DeepMind
Herramientas y productos 2 fuentes

Google Search incorpora herramientas de IA para planificar actividades y eventos offline

Google ha publicado una serie de casos de uso de su modo IA en Search orientados a ayudar a usuarios a planificar actividades fuera de línea: búsqueda de…

Por qué importaMuestra cómo Google está implementando capacidades de IA en su motor de búsqueda para casos de uso prácticos y cotidianos, reflejando tendencias de…

Impacto bajo Fiabilidad confirmado por varias fuentes Google AI
Herramientas y productos 2 fuentes

Google añade herramientas de IA a Búsqueda para planificar cenas y eventos

Google ha integrado nuevas funcionalidades de IA en su motor de búsqueda para asistir en la planificación de cenas, incluyendo visualización de decoraciones de…

Por qué importaDemuestra la expansión de la IA generativa en el flujo de trabajo de búsqueda para tareas cotidianas de consumidor, mostrando cómo los modelos de…

Impacto bajo Fiabilidad confirmado por varias fuentes Google AI
Herramientas y productos 2 fuentes

Google integra Gemini Intelligence en Samsung Galaxy Z Fold8 y Flip8 con automatización de tareas

Google anunció en Galaxy Unpacked 2026 la integración de Gemini Intelligence en los nuevos Samsung Galaxy Z Fold8, Fold8 Ultra y Flip8. Los dispositivos…

Por qué importaRepresenta la expansión de agentes IA proactivos a dispositivos móviles con capacidades de automatización de procesos reales, no solo consultas…

Impacto alto Fiabilidad confirmado por varias fuentes Google AI

Google DeepMind resume los avances de 2023: Bard, PaLM 2, Gemini y mejoras en código

Google DeepMind publica un resumen de 2023 destacando el lanzamiento de Bard (febrero), PaLM 2 (mayo), Gemini (diciembre) en tres tamaños (Nano, Pro, Ultra) y…

Por qué importaDocumenta los hitos técnicos más relevantes de Google DeepMind en un año de consolidación de IA generativa, con métricas verificables sobre desempeño…

Impacto alto Fiabilidad fuente primaria Google DeepMind

Google DeepMind presenta Aeneas, modelo de IA para interpretar inscripciones romanas

Google DeepMind ha publicado en Nature un paper presentando Aeneas, el primer modelo de IA especializado en contextualizar inscripciones latinas antiguas. El…

Por qué importaDemuestra la aplicación práctica de IA generativa en investigación académica especializada, mostrando cómo los modelos multimodales pueden acelerar…

Impacto medio Fiabilidad fuente primaria Google DeepMind