La inteligencia artificial llega a las retransmisiones con análisis de vídeo, generación de fotogramas, traducción y mejora de imagen en tiempo real. NVIDIA presenta en IBC su tecnología de inteligencia artificial para retransmisiones, deportes y streaming, incluido un detector de vídeo sintético. La compañía ha anunciado en IBC 2026, celebrada en Ámsterdam, una ampliación de NVIDIA AI for Media con herramientas dirigidas a producción audiovisual, deportes, noticias y distribución de contenidos.

La feria se celebra del 11 al 14 de septiembre y reúne a más de 44.000 asistentes procedentes de más de 170 países. El programa incluye más de 1.300 expositores repartidos en más de 14 pabellones y espacios exteriores, además de más de 600 ponentes. NVIDIA ha aprovechado el encuentro para mostrar aplicaciones que procesan audio, vídeo, movimiento y efectos de realidad aumentada sin modificar los entornos de emisión habituales.

El detector de vídeo sintético de NVIDIA alcanza un 99,3% con contenido de texto a vídeo

NVIDIA AI for Media agrupa SDK acelerados por GPU, microservicios NVIDIA NIM, guías de implementación y arquitecturas de referencia. El conjunto busca facilitar la comprensión del movimiento, la verificación de vídeos, la mejora de imagen, la localización de programas y el desarrollo de aplicaciones audiovisuales basadas en IA.

El detector de vídeo sintético de NVIDIA se llama NVIDIA Synthetic Video Detector (SVD). Es un microservicio NIM presentado inicialmente a comienzos de año durante SIGGRAPH. Su función es calcular la probabilidad de que una grabación sea auténtica o haya sido creada mediante inteligencia artificial.

El resultado se plantea como un elemento adicional para los equipos editoriales, de autenticación de contenidos, análisis forense digital e integridad de medios. Desde su lanzamiento inicial, SVD ha alcanzado una precisión del 99,3% con contenidos generados de texto a vídeo. También ha logrado un 97,7% en contenidos de imagen a vídeo.

De hecho, NVIDIA señala que la mejora ha sido especialmente grande en los casos difíciles de imagen a vídeo. Sin embargo, el sistema no sustituye por sí solo a los procesos de revisión. Aporta puntuaciones y metadatos que otros equipos pueden valorar dentro de sus flujos de trabajo.

Dalet está incorporando SVD a un sistema seguro de verificación alojado en la nube para organizaciones informativas. Por tanto, los equipos editoriales podrán enviar las grabaciones al servicio. También podrán consultar las puntuaciones y los metadatos resultantes desde la interfaz de Dalet.

TwelveLabs ha anunciado la disponibilidad general de Compliance by TwelveLabs, su primera aplicación construida sobre la plataforma de inteligencia de vídeo de la empresa. La herramienta permite revisar contenidos con rapidez frente a requisitos de cumplimiento regionales y criterios personalizados. Además, al integrar SVD añade señales de autenticidad a nivel de fotograma y puntuaciones de confianza.

En cambio, los equipos pueden localizar posibles medios sintéticos dentro del mismo proceso de cumplimiento. Wowza distribuirá SVD mediante Wowza Video Intelligence Framework. La integración, basada en infraestructura acelerada por NVIDIA, permitirá analizar señales de vídeo en directo y extraer información sobre objetos, escenas y posibles signos de generación mediante IA en tiempo real.

La tecnología de servidor multimedia Wowza Streaming Engine está presente en más de 35.000 despliegues de vídeo repartidos por más de 170 países. El sistema podrá ejecutarse en las instalaciones de la organización, en el borde, en la nube. También podrá funcionar dentro de despliegues híbridos o en entornos completamente aislados de redes externas.

Por tanto, esa variedad de opciones ayuda a mantener bajo control los flujos audiovisuales considerados críticos. Otro componente es NVIDIA 3D Body Pose. Este componente calcula la posición y los ángulos de las articulaciones humanas en dos y tres dimensiones a partir del vídeo de una sola cámara.

El método transforma el movimiento en datos estructurados sin recurrir a sistemas de captura basados en marcadores. En el ámbito deportivo, esos datos pueden utilizarse para seguir los movimientos de jugadores y atletas. Además, sirven para estudiar la biomecánica y el rendimiento.

Por ejemplo, ayudan a mejorar repeticiones y apoyar tareas de arbitraje. También pueden aplicar sistemas relacionados con la seguridad de los jugadores. En cambio, los datos sirven para crear interacciones virtuales y experiencias inmersivas.

La misma información de movimiento puede alimentar procesos de creación de contenidos. Cuando se asigna a un rig de personaje compatible, los datos de articulaciones y desplazamiento sirven para bloquear animaciones. También permiten crear dobles digitales, retargeting de personajes y producciones virtuales.

Vizrt está usando Body Pose en estudios virtuales en directo. Allí, el movimiento corporal registrado controla en tiempo real efectos de iluminación 3D. De hecho, controla reflejos, sombras y representación del entorno.

Generación de fotogramas y HDR para suavizar repeticiones y mejorar emisiones

Video Frame Generation (VFG) emplea IA generativa para crear imágenes intermedias entre los fotogramas originales de un vídeo. El resultado hace que el movimiento parezca más fluido. Además, permite duplicar o cuadruplicar la frecuencia de imagen, manteniendo la calidad visual y la coherencia temporal.

La tecnología está orientada a deportes, repeticiones a cámara lenta y medios en directo. En concreto, también se dirige a otras escenas con mucho movimiento. Además, incluye conversión de frecuencia de imagen y aumento de fotogramas para flujos de trabajo que generan vídeo mediante IA.

Ross Video está integrando VFG en su plataforma Rio Replay. Por ejemplo, produce repeticiones deportivas a cámara lenta con asistencia de inteligencia artificial. El desarrollo actual permite generar ralentizaciones de 6x.

En cambio, trabaja hacia una interpolación de 8x. La generación de fotogramas intermedios puede suavizar la reproducción sin exigir que cada imagen haya sido capturada por una cámara con una frecuencia de imagen ultr elevada.

El detector de vídeo sintético de NVIDIA utiliza IA para aumentar la resolución del vídeo y reducir ruido, desenfoque y artefactos de compresión. Los nuevos modos de streaming permiten priorizar el rendimiento en tiempo real o una mayor calidad de imagen.

También se pueden ajustar distintos controles para definir el nivel de mejora. El detector de vídeo sintético de NVIDIA incorpora compatibilidad con vídeo de 10 bits y mejoras tanto de rendimiento como de calidad. Está disponible a través de NVIDIA Video Effects SDK.

Además, también se ofrece como microservicio NIM para aplicaciones de streaming, retransmisión, videoconferencia, reproducción de vídeo y creación de contenidos. La herramienta puede integrarse en reproductores de vídeo. También puede integrarse en aplicaciones de reuniones, herramientas para creadores y servicios de streaming.

Por tanto, se puede usar en transcodificadores y sistemas de emisión mediante una interfaz común. NVIDIA TrueHDR transforma vídeo de rango dinámico estándar en una salida de alto rango dinámico en tiempo real. Puede alcanzar aproximadamente 2.000 nits y conservar el contraste local.

De hecho, adapta el brillo al contenido. VSR, VFG y TrueHDR pueden combinarse dentro de una misma cadena de efectos de vídeo. Por tanto, la combinación está planteada para mejorar catálogos existentes destinados a streaming, transcodificación, videojuegos y flujos de creación.

  • VFG: genera fotogramas intermedios y puede duplicar o cuadruplicar la frecuencia de imagen.
  • VSR: escala el vídeo y reduce ruido, desenfoque y artefactos de compresión.
  • TrueHDR: convierte vídeo SDR en HDR en tiempo real, con hasta aproximadamente 2.000 nits.
  • Integración: las tres tecnologías pueden formar parte de una única cadena de efectos audiovisuales.

Traducción, detección del hablante y una capa común para medios en directo

Los microservicios NVIDIA LipSync y Active Speaker Detection NIM están dirigidos a sistemas de localización para entrevistas, informativos, deportes, entretenimiento y programas con varias personas en pantalla. LipSync modifica el movimiento de la boca del vídeo de entrada para ajustarlo a una pista de audio diferente. Sin embargo, conserva la posición natural de la cabeza, el parpadeo y el movimiento corporal.

La nueva versión mejora el tratamiento de las oclusiones faciales. Además, mantiene mejor los dientes, los labios y las texturas del rostro. Active Speaker Detection ya no necesita diarización del hablante cuando trabaja con varias pistas de audio. También incorpora detección de actividad vocal.

Por tanto, amplía las posibilidades de despliegue mediante una interfaz gRPC. También ofrece una compatibilidad más amplia con GPU. NDI está utilizando NVIDIA AI for Media, incluido el microservicio NVIDIA LipSync NIM, para ofrecer traducción en tiempo real, doblaje sincronizado con los labios y adaptación a idiomas regionales.

Además, el método genera varias experiencias lingüísticas a partir de una señal multimedia común. Según la descripción de NVIDIA, esto puede ayudar a llegar a audiencias internacionales. También puede reducir la infraestructura, el ancho de banda y la complejidad de producción que suelen exigir las distribuciones multilingües.

Studio Voice incorpora nuevos perfiles de micrófono basados en microservicios NVIDIA Studio Voice NIM. Los usuarios pueden elegir el carácter tonal de la voz procesada. De hecho, el sistema está diseñado para eliminar ruido de fondo y reducir la reverberación de la sala.

En cambio, mejora la claridad del habla antes de adaptar el resultado al perfil de micrófono seleccionado. La función está dirigida a comunicaciones en directo, streaming, pódcast y creación de contenidos. Para entender cómo encaja este tipo de software en infraestructuras domésticas conectadas, también hemos analizado el nuevo sistema de alertas de Home Assistant.

Sin embargo, la propuesta de NVIDIA se dirige a flujos profesionales de medios. La segunda gran línea presentada en IBC es NVIDIA Holoscan for Media con Media Exchange Layer (MXL). La combinación ofrece una capa común para conectar aplicaciones de medios. Además, permite que intercambien vídeo, audio y datos en directo dentro de entornos distribuidos.

Holoscan for Media es una arquitectura de referencia abierta. También es un kit para desarrolladores pensado para crear funciones y aplicaciones de medios basadas en IA para producción definida por software. MXL proporciona el mecanismo abierto de intercambio entre esas funciones.

A medida que las tareas de producción pasan al software, los desarrolladores pueden compartir infraestructura acelerada. Por tanto, pueden conectar aplicaciones dinámicamente y mantenerlas independientes. NVIDIA sostiene que este planteamiento puede mejorar el uso de la infraestructura, acelerar la incorporación de nuevas capacidades y reducir la integración personalizada entre aplicaciones.

La misma integración ofrece una base para combinar procesamiento de IA, aplicaciones de vídeo y funciones audiovisuales tradicionales. Así, se integran dentro de una infraestructura acelerada y un entorno definido por software. Para los proveedores tecnológicos, amplía la posibilidad de crear aplicaciones compatibles con entornos de varios fabricantes.

Para las empresas de medios, plantea una infraestructura capaz de adaptarse a cambios de formatos, aplicaciones y capacidades de IA. La demostración de Holoscan for Media estará disponible en el estand 10.D21 de EBU durante IBC 2026.

Los playbooks deportivos preparan modelos multimodales con datos propios

El deporte se está utilizando como campo de aplicación para un cambio más amplio en inteligencia artificial. La idea consiste en pasar de modelos de propósito general a modelos abiertos ajustados con datos propios. Por tanto, los NVIDIA Sports Intelligence Playbooks aceleran esa transición.

Ofrecen a ligas, empresas de medios y proveedores tecnológicos marcos estructurados para ajustar modelos multimodales a sus necesidades. La fuente también presenta esta línea como parte de la propuesta de NVIDIA. En concreto, busca conectar datos deportivos, vídeo en directo y aplicaciones basadas en IA dentro de flujos de producción.

El conjunto mostrado en IBC reúne, además, dos capas de trabajo. Por un lado, incluye herramientas concretas para verificar vídeos, seguir movimientos y generar repeticiones. También mejora imágenes y adapta contenidos a otros idiomas.

Por otro lado, ofrece una infraestructura compartida para conectar esas funciones. Así, las aplicaciones trabajan sobre los mismos recursos acelerados. NVIDIA presenta estas capacidades en IBC 2026 junto con sus socios.

Además, la compañía ofrece demostraciones de los microservicios NVIDIA AI for Media y de los flujos de trabajo desarrollados con ellos durante la feria de Ámsterdam.

Puedes seguir a HardwarePremium en Facebook, Twitter (X), Instagram, Threads, BlueSky o Youtube. También puedes consultar nuestro canal de Telegram para estar al día con las últimas noticias de tecnología.

FAQ

¿Qué porcentaje de precisión alcanza NVIDIA Synthetic Video Detector?

El detector de vídeo sintético de NVIDIA llega al 99,3% con contenido generado de texto a vídeo y al 97,7% con contenido de imagen a vídeo. NVIDIA indica que la mejora ha sido especialmente notable en los casos difíciles de imagen a vídeo.

¿Dónde se puede ejecutar el sistema de análisis de vídeo?

La solución distribuida mediante Wowza puede desplegarse en las instalaciones, en el borde, en la nube, en entornos híbridos o completamente aislados. Dalet también trabaja con una versión alojada en la nube para organizaciones informativas.

¿Qué mejoras ofrece Video Frame Generation en deportes?

VFG crea fotogramas intermedios para suavizar repeticiones y puede multiplicar por dos o por cuatro la frecuencia de imagen. Ross Video trabaja con una generación de cámara lenta de 6x y desarrolla una interpolación de 8x para Rio Replay.

¿Qué aporta Media Exchange Layer a Holoscan for Media?

MXL permite intercambiar vídeo, audio y datos entre aplicaciones de medios distribuidas. La demostración de esta integración se realiza en el estand 10.D21 de EBU durante IBC 2026.

🔥 ¿Tienes un minuto? Dale al play, te van a engancharSuscríbete al canal
🔴 NUEVOASUS VG27UQEL5A: el dual mode asequible que promete muchoASUS VG27UQEL5A: el dual mode asequible que promete mucho
Windows PUNTÚA tu PC y casi nadie lo sabe 😱Windows PUNTÚA tu PC y casi nadie lo sabe 😱
Los NUEVOS volantes de MOZA con Mercedes, Porsche y FordLos NUEVOS volantes de MOZA con Mercedes, Porsche y Ford
ASUS ROG Spatha X 65K: ¡12 BOTONES y 65.000 DPI! 🔥 #ShortsASUS ROG Spatha X 65K: ¡12 BOTONES y 65.000 DPI! 🔥 #Shorts
ASUS ROG celebra 20 AÑOS con esta ROG ALLY X20 🔥 | Gamescom 2026 #ShortsASUS ROG celebra 20 AÑOS con esta ROG ALLY X20 🔥 | Gamescom 2026 #Shorts

Comentarios

Cargando comentarios…
QIDI Plus5