Las manos y los rostros generados por IA en los vídeos salen mal porque un modelo debe mantener la coherencia en cuanto a anatomía, identidad, iluminación, postura y movimiento a lo largo de muchos fotogramas, y no solo dibujar una imagen convincente. Una mano que parece correcta en el fotograma 20 puede cruzar el rostro en el fotograma 24, cambiar la separación entre los dedos en el fotograma 26 y fundirse con el pelo en el fotograma 28. El modelo tiene que corregir entonces varias zonas dudosas a la vez.
Probamos una indicación breve y cordial frente a una indicación mucho más restrictiva con la palma abierta a través de la interfaz de línea de comandos (CLI) de GlobalGPT. La versión con restricciones generó un movimiento más suave y una postura de la mano más clara. No conservó la identidad de la persona original, ni su ropa, ni el micrófono, ni la habitación. Ese resultado mixto resulta más útil que una demostración perfecta, ya que muestra lo que las restricciones de la indicación pueden y no pueden controlar.

Por qué las manos pierden su función con el paso del tiempo
Las manos son objetos articulados con muchas partes pequeñas, que a menudo se ocultan entre sí y cuyos contornos cambian rápidamente. Una mano que saluda gira, los dedos se superponen, el desenfoque de movimiento suaviza los bordes y la palma se mueve con respecto al rostro. El generador debe deducir una estructura 3D coherente a partir de cada nueva vista, al tiempo que mantiene el fotograma anterior.
Los problemas se manifiestan en forma de dedos de más, dedos fusionados, cambios en la posición de las uñas, muñecas elásticas o una mano que cambia de lado. En términos más generales, Diagnóstico de averías en vídeos mediante IA ayuda a distinguir los errores anatómicos de los errores relacionados con la cámara, la física y la continuidad.
¿Por qué las caras se ven distorsionadas aunque un fotograma se vea bien?
El rostro es sensible a los cambios más sutiles en la distancia entre los ojos, la forma de los párpados, las comisuras de la boca, la anchura de la nariz y la línea del cabello. El habla y las expresiones modifican continuamente esos puntos de referencia. Si el rostro se hace más pequeño, se gira hacia otro lado, queda oculto por una sombra o está parcialmente cubierto por una mano, el modelo dispone de menos información y puede que tenga que volver a definir la identidad.
Por eso Flujo de trabajo para la coherencia de los vídeos generados por IA considera la estabilidad del personaje como un problema de secuencia. Un primer fotograma sólido ayuda, pero la indicación, la cámara, la duración y el movimiento también deben proteger la señal de identidad.
Nuestra prueba de referencia y nuestra prueba con restricciones
En ambas pruebas se utilizó la misma imagen de origen y la ruta «Grok Imagine» a una resolución de 1280×720 durante unos cinco segundos. En la prueba de referencia se le pidió a la mujer que se girara hacia la cámara y saludara con la mano. La indicación restringida especificaba la mano derecha, exigía que los cinco dedos estuvieran separados, que la mano se mantuviera junto al hombro, prohibía que se ocultara el rostro, limitaba el movimiento de la cabeza y fijaba la cámara.
Cada tarea costó 500 créditos. Se trata de una observación A/B con una ejecución por cada indicación, no de un experimento controlado estadísticamente. Tomamos muestras de intervalos de tiempo fijos y revisamos los vídeos a velocidad normal.
Resultado de referencia: movimiento dinámico, desviación importante de la identidad
La línea de base generó un saludo con la mano amistoso y enérgico. La mano abierta se seguía distinguiendo en los fotogramas muestreados, pero el resultado final sustituyó al presentador original por una mujer de aspecto diferente, en otra habitación y con otro atuendo. La composición cambió incluso antes de que el saludo con la mano se convirtiera en la acción principal.
Este resultado demuestra por qué no basta con que una interfaz resulte visualmente atractiva. Si el puesto requiere un presentador habitual, la identidad y el entorno son criterios de aceptación fundamentales. El crear un personaje coherente a partir de una sola foto aborda las decisiones relativas a la imagen de origen que pueden mejorar la referencia inicial, pero nuestro resultado demuestra que una sola imagen de origen no garantiza la continuidad.
Resultado con restricciones: mejor pose, pero la identidad sigue sin recuperarse
El movimiento restringido era más lento, la mano se mantenía junto a la cabeza y adoptaba una postura más nítida, con la palma abierta. La mano no se deslizaba por el rostro. Esas diferencias facilitaban el análisis del gesto y simplificarían la edición.
Sin embargo, la persona, la ropa, el micrófono y la habitación siguieron cambiando de forma sustancial. La instrucción pedía una preservación exacta y el modelo no la cumplió. Podemos decir que la ejecución con restricciones mejoró la legibilidad del movimiento en este caso concreto. No podemos afirmar que corrigiera la anatomía de forma general ni que preservara la identidad.
Propuestas de redacción sobre la visibilidad y el movimiento
Una indicación útil para los gestos con las manos debe especificar una extremidad, una acción, una posición y una duración. “Levanta la mano derecha, muestra la palma abierta junto al hombro, mantén la posición durante un segundo y bájala” es una indicación que se puede comprobar. “Haz gestos de forma natural mientras hablas con entusiasmo” deja sin especificar muchas articulaciones, velocidades y oclusiones.
El lenguaje de la cámara también es importante. Mantén la cámara fija, mantén toda la mano dentro del encuadre y evita los zooms bruscos durante el gesto. El controles de la cámara y de las indicaciones de movimiento ofrece un vocabulario más amplio en lo que respecta a la cámara y al control de movimiento, mientras que Técnicas de estimulación del movimiento Veo incorpora técnicas de indicaciones específicas para Veo.
Protege el rostro antes de aumentar el rendimiento
Asegúrate de que el rostro se vea lo suficientemente grande como para poder leerlo. Limita los giros de cabeza, las expresiones exageradas y el cruzar las manos en los momentos clave para la identificación del personaje. Busca parpadeos sutiles y pequeños movimientos de la boca antes de combinar el diálogo, un atrezo y una cámara en movimiento. Añade complejidad solo después de que la toma más sencilla haya salido bien.
En el caso de secuencias largas, divide la actuación en planos con fotogramas iniciales y finales estables. El Coherencia de los personajes en los vídeos largos explica por qué resulta cada vez más difícil mantener la continuidad de los personajes a medida que se acumulan los fragmentos y cómo los puntos de referencia ayudan a superar los cortes.
Crear un marco de origen mejorado
Utiliza una imagen nítida y con iluminación uniforme en la que se vean ambos ojos, con una silueta del pelo bien definida y con las manos totalmente visibles o completamente fuera del encuadre. Evita que los dedos queden cortados por el borde del encuadre, los filtros de belleza excesivos, el desenfoque de movimiento muy marcado y los fondos con motivos que se crucen con el cuerpo.
El fotograma de referencia también debe ajustarse a la composición prevista del vídeo. Pedir que un retrato en primer plano se convierta en una toma de medio cuerpo obliga al modelo a inventarse de golpe los brazos, las manos, la ropa y los detalles del entorno. Genera o fotografía el encuadre necesario antes de la animación.
Detectar los fallos en lugar de reescribirlo todo
- Si los dedos se juntan, ralentiza el movimiento y aleja la mano de la cara o del cuerpo.
- Si la identidad se desvía, reduce la rotación de la cabeza, el rango de expresión y la duración del clip.
- Si la muñeca se dobla de forma extraña, simplifica la trayectoria de la mano y elimina la interacción con los objetos de apoyo.
- Si cambia el fondo, fija la cámara y describe los puntos de referencia fijos de la escena.
- Si aparecen varios fallos a la vez, vuelve a un fotograma de origen más limpio.
Errores habituales en los vídeos generados por IA enumera los errores habituales de planificación que suelen provocar estos fallos encadenados.
Indicaciones de referencia copiables y con restricciones
Ejecuta primero la línea de base corta para que puedas ver qué elige el modelo sin ayuda. A continuación, cambia únicamente las restricciones de movimiento. Mantén el modelo, la fuente, la duración y la relación de aspecto. Esto hace que la comparación sea más fácil de interpretar, aunque dos muestras aisladas no puedan demostrar una relación de causalidad.
Repásalo fotograma a fotograma y, después, a velocidad normal
La reproducción a velocidad normal permite apreciar si el movimiento resulta natural. El avance fotograma a fotograma revela cuándo la anatomía o la identidad empiezan a desviarse. Comprueba el inicio, el punto álgido del gesto, el punto de oclusión y la postura final. Fíjate en ambas manos, no solo en la que saluda, y compara la forma de los ojos y las comisuras de los labios con las del material original.
Anota el primer fotograma defectuoso. Eso te indicará si debes cambiar la fuente, acortar la toma o limitar una transición concreta. Una nota vaga del tipo “parece raro” es difícil de convertir en una indicación más concreta.
Considerar la oclusión como un riesgo de producción
La oclusión se produce cuando un objeto oculta a otro: los dedos cruzan el rostro, el pelo tapa un ojo, un accesorio oculta la muñeca o el cuerpo se gira alejándose de la cámara. Aún así, hay que deducir la estructura oculta, y el modelo puede reconstruirla con una forma diferente. El movimiento rápido dificulta esa deducción, ya que los fotogramas adyacentes proporcionan información menos estable.
Organiza la acción de forma que las partes anatómicas importantes permanezcan visibles. Coloca la mano junto a la cara, en lugar de delante de ella. Mantén los accesorios alejados de las articulaciones de los dedos. Si el contacto es imprescindible, divide la acción en tomas de aproximación, contacto y separación, y luego móntalas juntas. Esto reduce el número de transiciones bruscas que debe resolver un generador.
Repite la prueba antes de sacar una conclusión precipitada
Nuestros dos vídeos son observaciones útiles, pero una sola semilla puede favorecer o perjudicar una indicación. Para elegir el modelo adecuado, repite cada indicación varias veces con la misma fuente y los mismos ajustes. Valora por separado la legibilidad manual, la identidad, el fondo, la cámara y la finalización de la acción. Anota en el registro los resultados rechazados.
Una prueba repetida puede revelar si la indicación restringida aumenta la probabilidad de obtener una pose útil o si simplemente ha generado una muestra afortunada. También puede poner de manifiesto una disyuntiva: un control más estricto del movimiento puede reducir la expresividad o dar lugar a una interpretación más rígida. Elige el equilibrio que mejor se adapte a la toma, en lugar de perseguir un único fotograma perfecto.
Saber cuándo editar y cuándo regenerar
Edita para corregir un pequeño defecto cuando la identidad, la acción y la cámara sean, por lo demás, sólidas. Un breve corte puede ocultar un colapso del dedo en dos fotogramas; un recorte más ajustado puede eliminar una pose de retorno incorrecta. Vuelve a generar la animación cuando el rostro cambie a lo largo de la secuencia, la mano equivocada realice la acción, el fondo se transforme o la anatomía presente errores en muchos fotogramas.
No dediques una hora a corregir un fragmento que incumpla los requisitos fundamentales del briefing. Por el contrario, tampoco descartes una actuación excelente por un pequeño problema que se pueda ocultar con un montaje normal. La lista de comprobación para la aceptación debe distinguir entre fallos graves e imperfecciones que se puedan subsanar antes de que comience la revisión.
Utiliza una lista de comprobación para la aceptación de los movimientos humanos
En cada toma, puntúa cinco aspectos de forma independiente: identidad, anatomía, acción, cámara y escena. La identidad abarca las proporciones faciales, el pelo y la ropa. La anatomía abarca los dedos, las muñecas, los codos, los dientes y el movimiento de los ojos. La acción comprueba si el movimiento solicitado comienza, alcanza su punto álgido y finaliza correctamente. La cámara abarca el encuadre y los movimientos no deseados. La escena abarca la continuidad de los accesorios, el fondo y la iluminación.
Marca cada secuencia como «aprobada», «reparable» o «rechazada». Un resultado «reparable» puede contener un fotograma defectuoso breve que se puede recortar sin alterar el significado. Un resultado «rechazado» presenta una desviación persistente de la identidad, un colapso repetido de las manos o una acción que falta. Esta clasificación evita que se pase por alto un clip visualmente atractivo que contenga un error de continuidad grave.
Revisa el sonido por separado, incluso cuando el artículo se centre en los rostros y las manos. Un audio inesperado, artefactos en el sonido o una pista que falte pueden hacer que una toma visualmente aceptable resulte inservible. La toma definitiva es el archivo que cumple con todas las especificaciones de entrega, no el fotograma que mejor queda en una hoja de contacto.
El veredicto práctico
Nuestra indicación restringida generó un gesto con la mano más tranquilo y legible que el de referencia, pero en ambos resultados la identidad cambió drásticamente. La ingeniería de indicaciones mejoró un aspecto sin resolver por completo el problema de la continuidad.
Un método listo para la producción combina una fuente bien encuadrada, una acción controlada, una cámara estable, tomas repetidas y una lista de comprobación de aceptación por escrito. Cuando el sujeto tenga que hablar o manejar un atrezo, comprueba esos comportamientos en tomas cortas e independientes antes de combinarlos. La complejidad debe ganarse mediante pruebas satisfactorias.
No juzgues los movimientos basándote únicamente en el fotograma final. Observa todo el recorrido del gesto, desde el inicio hasta el final, y luego compara la cara con la imagen original. Una palma limpia no puede compensar que se trate de otra persona, y una cara estable no puede compensar que la muñeca se doble durante la acción.
Compara las rutas de vídeo en GlobalGPT Cuando falle una imagen, cambia una variable cada vez y anota la fuente, los ajustes y el motivo del rechazo. Las mejores manos y rostros se consiguen reduciendo la incertidumbre a lo largo de la secuencia, no añadiendo una “anatomía perfecta” a una indicación sobrecargada.
Para la siguiente prueba, repite ambas indicaciones varias veces con la misma fuente y puntúa por separado la identidad, la anatomía, la acción, la cámara y la escena. Esa pequeña muestra mostrará si la indicación restringida mejora la tasa de tomas válidas o si simplemente ha dado lugar a un resultado afortunado. Mantén el movimiento breve y visible hasta que el gesto principal sea estable. A continuación, añade diálogo, atrezo o movimiento de cámara de uno en uno, conservando una versión limpia de cada fase que haya superado la revisión.
Preguntas frecuentes
¿Por qué las manos de los vídeos generados por IA tienen dedos de más?
La rápida articulación, la autooclusión, el desenfoque de movimiento y los cambios de punto de vista hacen que la estructura de los dedos resulte incierta de un fotograma a otro. Es posible que el modelo redibuje la mano de forma diferente a medida que se mueve.
¿Por qué cambia el rostro en un vídeo generado por IA?
Los rostros pequeños, los giros de la cabeza, las expresiones, las sombras y la oclusión debilitan los indicios de identidad. A continuación, el generador reconstruye los puntos de referencia faciales en lugar de conservarlos exactamente.
¿Puede una indicación mejor solucionar los problemas de la IA?
Una guía restringida puede reducir el movimiento y la oclusión, lo que mejoró la legibilidad en nuestra única prueba. No puede garantizar una anatomía correcta en todos los modelos ni en todas las ejecuciones.
¿Garantiza una imagen de referencia la coherencia de la identidad?
No. Una fuente de luz potente ayuda, pero el modelo de vídeo puede seguir modificando la persona, la ropa, la habitación o la composición de la cámara mientras hay movimiento.
¿Qué movimiento de cámara es el más seguro para los rostros y las manos?
Una cámara fija con una composición media o de cintura para arriba es el punto de partida más seguro. Añade movimientos panorámicos, zooms o giros solo una vez que haya pasado el gesto sencillo.
¿Puedo cambiar de modelo cuando una toma sale mal una y otra vez?
Sí. GlobalGPT te permite comparar las rutas de vídeo disponibles. Mantén constantes la fuente y los criterios de aceptación para que puedas evaluar si el cambio en el modelo realmente ayuda.




