Primero, esto no es un anuncio. Este video se grabó de forma muy repentina porque ByteDance acaba de lanzar un modelo llamado Seedance 2.0. Normalmente, mi actitud ante los modelos de IA es: "Oh, oh, otro lanzamiento, luego promocionarán un montón de conceptos geniales, pero la experiencia real no será muy buena y luego se olvidará". Pero con este modelo, al principio, cuando lo vi en un video, pensé: "Ah, ¿esto también se puede hacer?". Por ejemplo, mira esto. El punto clave es su nivel de detalle, ¿verdad? Esto es realmente impresionante. Luego vi que la gente en línea ya estaba produciendo contenido, como este o este. No digo que sea perfecto, pero se nota claramente que es mucho más potente que los videos de IA anteriores, ¿verdad? En ese momento, sentí que este modelo no era tan simple. Luego, nuestra propia empresa pudo empezar a producir contenido, y yo mismo lo probé. Mi sensación es que realmente tienes que probarlo por ti mismo. Si a principios de 2026 los modelos de generación de video ya están a este nivel, entonces siento que el proceso tradicional de producción cinematográfica ya ha entrado en la cuenta regresiva para ser arrastrado por el tsunami de la IA. No estoy exagerando. Echemos un vistazo a cómo son los modelos de generación de video hoy en día.
De hecho, los modelos de generación de video anteriores ya eran bastante buenos y parecían convincentes, pero había algunos puntos débiles que podías explotar: el movimiento de cámara a gran escala, la continuidad de los planos y la sincronización de audio y video. Entonces, veamos el rendimiento de CDance 2.0 desde estos tres puntos débiles. Primero, el movimiento a gran escala. Le pedimos al director de IA de la compañía que escribiera este texto y también le dimos imágenes, sin ninguna otra información. Este es el resultado que obtuvimos. ¿No es impresionante? Este tipo de movimiento de cámara ahora puede ser generado por la IA. ¿Qué? ¿Quieres cambiar a un movimiento de cámara aún más extravagante? No hay problema. Cambiamos el prompt y echamos otro vistazo. De todos modos, no hace falta decir mucho más. En el pasado, para identificar videos de IA, veíamos si el movimiento de la cámara era falso o no. Este método ya ha quedado básicamente obsoleto. Ahora pasemos al segundo punto: los planos. Los modelos anteriores podían generar planos, ¿verdad? Pero los planos anteriores eran así: era un poco "cortar por cortar", a lo sumo daban un primer plano y luego un plano general. El movimiento de cámara en sí no era fluido, al menos era diferente del lenguaje audiovisual que hacemos los humanos. Bueno, ahora veamos lo más impactante de este modelo. Veamos un video generado con una sola frase y su diseño de planos. No sé si lo has notado, pero no solo da primeros planos, sino que tiene cambios de ángulo claros y hay una intención de director detrás, y los personajes no se deforman. Quizás lo que digo no sea lo suficientemente claro. Usemos una vista aérea para simular y ver los cambios en su posición. Mira este corte, este corte, este corte. Es como un director humano, cambiando constantemente la posición y el ángulo de la cámara para que tú, el espectador, puedas tener una mejor comprensión del contenido importante. Hay un pensamiento de director presente aquí, un punto de enfoque. Antes, lo que pensaba era que la IA generaría un video por segmentos, y luego un editor lo uniría para crear una obra impresionante. Pero ahora, debemos darnos cuenta de que una vez que este modelo madure, no se necesitarán editores en el futuro. No tiene el concepto de selección o tomas fallidas. Todo lo que produce es útil. Si los planos generados son lo suficientemente buenos, ¿por qué necesitaría un editor? Realmente siempre pensé que la edición era una expresión emocional. Si insertas unos pocos fotogramas, tus emociones cambiarán, por lo que debe ser hecho por humanos. Pero ahora debemos enfrentar este problema: ¿cómo te aseguras de que tu pensamiento al insertar esos pocos fotogramas sea mejor que los pocos fotogramas insertados por la IA, especialmente cuando puede darte innumerables versiones y muy rápidamente?
Ahora pasemos al último punto: la sincronización de audio y video. Si un video no tiene sonido, su valor se reduce considerablemente. El mayor problema de la IA en el pasado era que el sonido que generaba era muy falso, especialmente cuando se mezclaba la voz humana con el sonido ambiente y la música, no sonaba natural. Entonces, veamos el efecto de este modelo. No está mal, ¿verdad? Debes saber que antes, hacer efectos de sonido y mezclas requería que una persona los pegara manualmente uno por uno, lo que tomaba un día o más. Ahora, se hace con un solo clic. Sin embargo, en la industria actual, si hablamos de modelos de sonido, ya hay muchos buenos. No creo que esto te parezca muy impactante, pero quiero contar algo que descubrimos por accidente y que es bastante aterrador: descubrí un punto. Tan pronto como subí mi cara, mi propia cara, a CDance 2.0, esta IA automáticamente habló con mi voz. Ah, no estoy seguro de si entiendes lo que estoy diciendo. Es decir, sin dar ninguna pista, ninguna palabra, ninguna información, y sin dar mi archivo de voz, solo subí mi cara (esto no es un anuncio), esta IA realmente sabía que la voz de esta cara era la mía. Esta voz. Les voy a mostrar. Este es el resultado que obtuvimos al usar una frase y mi foto. Normalmente, mi actitud ante los modelos de IA es: "Oh, oh, otro lanzamiento, luego promocionarán un montón de conceptos geniales, pero la experiencia real no es buena y luego se olvida". Pero el video de demostración que vi de este modelo al principio me hizo pensar: "Ah, ¿no te parece aterrador?". Y lo más aterrador no es solo mi voz, sino que la foto que subimos es así, ¿verdad? Solo la fachada del edificio. Pero mira el movimiento de cámara, puede girar hacia el otro lado del edificio. ¿Y cómo es el otro lado de nuestro edificio en la realidad? Es así. ¿No es aterrador? Sabe lo que hay detrás de mí, incluso si no se lo dije. Esto básicamente puede confirmar una cosa: CDance 2.0 ha sido entrenado con una gran cantidad de videos de nuestra empresa. Entonces, seguramente preguntarás: "Team, Team, ¿te pidieron derechos de autor?". Bueno, en pocas palabras, no sé si los términos de servicio de la plataforma ocultan una cláusula de autorización similar, pero yo personalmente no he recibido dinero ni me han contactado para una autorización. Quizás legalmente sean conformes, pero esto es un poco aterrador, ¿verdad? Lo que es aún más aterrador es que probamos con otros vloggers, como He Tongxue, y verás que la consistencia de la imagen del personaje es súper alta. La arena que solemos ver se forma por la erosión prolongada de las rocas, todos son regalos que el tiempo nos da. Ah, pero quizás la calidad de audio de los videos de He Tongxue todavía tiene margen de mejora. El resultado es que descubrimos que CDance esta vez eligió usar mi voz para darme a él. Y muchas otras personas también obtuvieron mi voz inexplicablemente. De todos modos, esto es un poco gracioso, pero creo que después de reír, debemos volver a la seriedad. Sinceramente, creo que todos debemos estar alerta ahora, porque somos un caso de estudio. Las empresas que subieron por primera vez toda la información y los datos, especialmente los datos de imagen y sonido, a la nube, y yo como individuo, especialmente el contenido de alta definición, ahora pueden ver lo que sucede si los datos de una persona entran completamente en el conjunto de datos de la IA. Puede simular al cien por cien cualquiera de tus formas y sonidos. Entonces, ¿tus familiares podrían distinguir el valor de ese contenido? Creo que al llegar a este punto, deberías entender por qué estamos haciendo este video. Esto no es una pequeña innovación tecnológica. Esto es un tsunami que arrasará con todos los procesos y sedimentos pasados de la industria. Así lo describiría yo. Y antes de terminar, quiero dar otro ejemplo. Hace un tiempo, publicamos un video: "La IA puede reemplazarme, ¿cuál es mi significado?". En ese video, contamos cómo ayudamos a un fan con un tumor a hacer un videoclip, dedicando dos años a los efectos especiales, pero al final nos dimos cuenta de que cuanto más me esforzaba, menos podía competir con la velocidad de progreso de la IA. Lo que aprendí antes tenía cada vez menos valor. En 2022 y 2023, hacer manualmente tomas como esta de un tren volando tomaba entre decenas y cientos de horas. Y en 2023, la IA podía hacer resultados como este en unos pocos minutos. No muy bien, pero en 2025, dos años después, a medio plazo, la IA puede producir resultados como este, que ya son muy potentes, ¿verdad? Entonces, ¿qué pasa con CDance 2.0 de hoy? También lo probamos. Este es el resultado actual. Así que, no hace falta decir más. Realmente creo que si lo pruebas tú mismo, este modelo de IA te ayudará a comprender mejor su lado aterrador. Todavía no se considera una IA que realmente haya cambiado la industria del video. En el fondo, creo que es así, pero la próxima IA que está por venir, la próxima versión, podría serlo. Entonces, ¿es esto bueno o malo para la humanidad?