Conversor 3D estereoscópico
Convierte un vídeo 2D corriente en un par estereoscópico lado a lado que puedes ver en 3D sin gafas, cruzando o relajando los ojos. Un modelo de profundidad lee cada fotograma y a partir de ahí se construye el segundo punto de vista. Todo ocurre en tu pestaña; no se sube nada.
- Estima la profundidad fotograma a fotograma y sintetiza el segundo ojo, así que sirve cualquier vídeo plano, no solo material grabado con dos cámaras
- Previsualiza un fotograma antes de lanzar la conversión, junto con el mapa de profundidad que produjo el modelo
Suelta tu vídeo aquí
Se queda en tu equipo y nunca se sube
Lee MP4, MOV, MKV, WebM, AVI, WMV, FLV, MPEG-TS, MPG, 3GP y casi cualquier otro formato que FFmpeg entienda.
Añade un vídeo para empezarSirve cualquier vídeo 2D corriente. La profundidad se deduce de la propia imagen, así que no hace falta una cámara especial.
Resumen
Qué hace la herramienta con un vídeo plano, y por qué está cada pieza.
- 01
Profundidad desde una sola vista
Un modelo neuronal de profundidad examina cada fotograma y estima a qué distancia está cada píxel, usando las mismas pistas con las que una persona lee una fotografía: oclusión, perspectiva, gradiente de textura, tamaño relativo. Eso es lo que permite usar cualquier vídeo como fuente, y no solo material grabado con dos cámaras.
- 02
Un segundo ojo sintetizado
El mapa de profundidad impulsa un desplazamiento horizontal: los píxeles cercanos se mueven más que los lejanos, que es exactamente lo que separa las dos imágenes que reciben tus ojos en el mundo real. Ambas vistas se desplazan la mitad del total en lugar de dejar una fija, así el encuadre queda centrado y cada vista abre solo la mitad de zona oculta.
- 03
Relleno de huecos con el fondo
Desplazar píxeles lateralmente deja al descubierto zonas que la cámara nunca registró, siempre en los bordes de los objetos más cercanos. Cada hueco se rellena desde el lado que está más lejos, porque a eso pertenece realmente la zona que falta. Rellenar desde el lado cercano es lo que produce ese halo gomoso alrededor de los sujetos en conversiones baratas.
- 04
Estabilizar la profundidad en el tiempo
Un modelo de profundidad aplicado a un fotograma no sabe nada del anterior, así que su salida tiembla incluso con la cámara fija. En estéreo eso se percibe como objetos que respiran en profundidad, lo más incómodo que puede hacer un vídeo convertido. Se suavizan entre fotogramas tanto el mapa de profundidad como el rango con el que se normaliza.
- 05
Salida paralela y cruzada
El mismo par sirve de las dos maneras; solo cambia el orden de las mitades. La visión cruzada funciona a cualquier tamaño, mientras que la paralela está limitada por la distancia entre tus ojos pero resulta más cómoda una vez le coges el punto.
- 06
Una vista previa antes de lanzar
La intensidad y el sitio donde queda el plano de la pantalla son ajustes perceptivos cuyo valor correcto depende del plano. Un fotograma recorre toda la cadena en segundos, mapa de profundidad incluido, así que esas decisiones se toman mirando una imagen y no la posición de un control.
- 07
Procesado por segmentos
El clip se convierte por trozos, cada uno extraído, convertido, codificado y descartado antes de empezar el siguiente. La memoria máxima depende por tanto del tamaño de un fotograma y no de la duración del vídeo, que es lo que hace posible convertir un clip entero dentro de una pestaña.
- 08
Se conserva la primera pista de audio
La primera pista de audio se multiplexa sobre el vídeo terminado en una sola pasada al final, en vez de cortarla y volver a unirla en cada segmento. Se copia sin recodificar cuando el contenedor puede transportarla, y solo se convierte a AAC cuando no. Las demás pistas de audio y los subtítulos no se conservan.
Cómo usarla
De un clip plano a algo que puedes ver en relieve.
- 01
Añade un vídeo. Sirve cualquier grabación 2D corriente: material de móvil, una captura de pantalla, una descarga. Nada sale de tu navegador.
- 02
Elige visión paralela o cruzada. Si nunca has visto en 3D sin gafas, empieza por la cruzada: a la mayoría le resulta más fácil y funciona a cualquier tamaño.
- 03
Fija el tamaño por ojo. Cuanto más pequeño, más fácil de fusionar y mucho más rápido de convertir. 640px encaja bien en la pantalla de un móvil.
- 04
Genera un fotograma en la vista previa y míralo. Ajusta la intensidad 3D hasta que la profundidad se lea con claridad sin que aparezcan manchas en los bordes.
- 05
Cambia la vista previa al mapa de profundidad. Claro es cerca, oscuro es lejos. Si el modelo ha leído mal la escena, aquí se ve mucho más claro que en el par estereoscópico.
- 06
Revisa el plan: tamaño de salida, cuántos segmentos, cuántos fotogramas y la memoria máxima que necesitará.
- 07
Pulsa Convertir. El progreso se informa por segmento con una estimación basada en la velocidad medida, no en una suposición. Mantén la pestaña en primer plano.
- 08
Reproduce el resultado, o descárgalo y míralo en un móvil, que es donde la visión paralela resulta más fácil.
Detalles
Los detalles que deciden si el resultado es algo que de verdad puedes ver.
- Estimación monocular de profundidad en cada fotograma, así que cualquier vídeo plano es una fuente válida
- Ambos ojos sintetizados con la mitad del desplazamiento cada uno, lo que reduce a la mitad la zona oculta que se descubre en cada vista
- Escritura de píxeles ordenada por profundidad, de modo que gana la superficie más cercana cuando dos caen en el mismo sitio
- Huecos rellenados desde el lado más lejano del borde, lo que evita el emborronado del primer plano típico de las conversiones baratas
- Profundidad suavizada entre fotogramas junto con la escala con que se normaliza, para que la escena no palpite cuando algo entra o sale del plano
- Disposición paralela o cruzada elegida en el momento de convertir, con una explicación de cómo ver cada una
- Vista previa por fotograma que muestra tanto el par estereoscópico como el mapa de profundidad del modelo
- Intensidad, plano de la pantalla y curva de profundidad ajustables, todos previsualizables antes de lanzar
- Límite de cadencia, para que el material de móvil a 60fps no cueste el doble de lo necesario
- Conversión por segmentos, así la memoria de trabajo depende del tamaño del fotograma y no de la duración
- Memoria máxima mostrada antes de lanzar, y aviso explícito cuando los fotogramas son demasiado grandes para procesarlos
- Estimación de tiempo medida a partir del rendimiento real y no predicha, ya que GPU y CPU difieren en un orden de magnitud
- La banda sonora original se traslada en una sola pasada, sin introducir desfase en los límites de los segmentos
- Salida como MP4 corriente que se reproduce en cualquier parte: el 3D está en la imagen, no en un formato especial
- Todo se ejecuta en la pestaña: sin subidas, sin colas, sin cuenta y sin marca de agua
Casos de uso
Por qué la gente quiere convertir un vídeo plano en un par estereoscópico.
-
Ver material antiguo con relieve
Los vídeos caseros, el material de archivo y todo lo grabado antes de que la captura estereoscópica fuera común existen solo como grabaciones planas. La estimación de profundidad es la única vía para conseguir un segundo punto de vista de material que ya no puede volver a rodarse, y ver sin gafas significa que tampoco hace falta ningún equipo para mirar el resultado.
-
Probar el estéreo sin comprar nada
Un visor o una pantalla 3D son una compra real para hacerla por una corazonada. Un par lado a lado visto con tus propios ojos no cuesta nada y responde a la pregunta de si el efecto te merece la pena, usando tu propio material y no un vídeo de demostración.
-
Preparar material para un visor de RV
Lado a lado es el formato que esperan la mayoría de reproductores de vídeo para visores. El mismo archivo que se ve sin gafas en un móvil se carga directamente en esos reproductores, así que esto sirve también para hacer visible en un visor una grabación corriente.
-
Tomas de dron y paisajes
El material aéreo y los paisajes amplios tienen una estructura de profundidad fuerte e inequívoca —crestas en primer plano, valles intermedios, horizonte lejano— que es justo el tipo de escena que un modelo de profundidad lee con fiabilidad. Se convierten mejor que casi cualquier otra cosa.
-
Vídeos de producto y objetos
Un solo objeto girando sobre un fondo liso se acerca al caso ideal: un sujeto claro, bordes limpios y un fondo despejado que deja poco que inventar cuando se abren huecos detrás.
-
Explicar la visión estereoscópica
Poder convertir un clip y mirar después el mapa de profundidad al lado hace visible el mecanismo de un modo que un diagrama no consigue. Los casos que fallan enseñan tanto como los que salen bien.
-
Material que no puede salir de tu equipo
Vídeos familiares, trabajos de cliente y cualquier cosa sujeta a un acuerdo no tienen por qué pasar por el servidor de otro solo para hacer un experimento. Aquí todo ocurre en la pestaña, y el panel de red te mostrará que no salió nada.
Ver también
Cada fotograma cuesta una estimación de profundidad lo conserves o no, así que recortar una grabación larga a la parte que de verdad quieres antes de convertir merece la pena, y de eso se encarga Recortar vídeo. El tamaño por ojo de aquí se fija pensando en ver sin gafas y no en la calidad, así que si necesitas el original a otro tamaño primero, usa Redimensionar y recortar vídeo. Y como el resultado siempre se escribe como MP4, convertirlo después a otro formato es lo que hace Conversor de vídeo.
Qué es realmente ver en 3D sin gafas
La idea detrás del estéreo sin gafas y la única restricción que decide si puedes verlo.
-
Dos imágenes, una para cada ojo
Todo el 3D estereoscópico funciona igual: se muestra a cada ojo una vista ligeramente distinta de la misma escena y el cerebro las fusiona en profundidad. El cine usa gafas polarizadas para repartir las dos imágenes; un visor usa dos pantallas. Ver sin gafas se salta el hardware haciendo que apuntes los ojos de modo que cada uno caiga sobre su mitad de una imagen lado a lado.
-
Paralela frente a cruzada
Son dos formas de apuntar. En la visión paralela los ojos se relajan hacia fuera, como mirando más allá de la pantalla, y la imagen izquierda va a la izquierda. La visión cruzada los dirige hacia dentro, delante de la pantalla, así que las mitades se intercambian. El mismo archivo no sirve para ambas: visto del modo equivocado, la profundidad se invierte y la imagen se vuelve del revés.
-
Por qué el tamaño importa en la visión paralela
Para fusionar un par en paralelo tus ojos no pueden girar más hacia fuera que el frente, porque el ojo humano no diverge. Eso pone un techo rígido a la separación entre puntos correspondientes: unos 63 mm, la distancia entre tus pupilas. En un móvil es sencillo. En un monitor de 27 pulgadas con el par a todo lo ancho, cada mitad mide unos 30 cm y fusionarla es sencillamente imposible.
-
Disparidad cruzada y no cruzada
Cuando un punto está delante de la pantalla, tus líneas de visión se cruzan antes de llegar a él y el ojo izquierdo lo ve más a la derecha: disparidad cruzada. Detrás de la pantalla ocurre lo contrario, y la separación queda acotada por el límite de divergencia anterior. Por eso el plano de la pantalla se sitúa por defecto en el extremo lejano: así todo flota hacia ti y nada se empuja más allá de lo que los ojos pueden hacer.
-
De dónde salen los artefactos
Dos cosas limitan cualquier conversión basada en profundidad. El modelo puede leer mal una escena —un póster en la pared tomado por una ventana, un reflejo tomado por profundidad— y de eso no se recupera con ningún ajuste, por lo que merece la pena mirar el mapa de profundidad. Y desplazar píxeles descubre fondo que nunca se filmó, así que hay que inventarlo. Ambos empeoran al subir la intensidad, y por eso los valores moderados suelen verse mejor.
-
Lo que esto no es
No es la ilusión anamórfica de las pantallas LED curvas de exterior: aquello se construye para una geometría de pantalla concreta y no puede deducirse de un vídeo plano. No es un holograma ni un campo de luz. Y no sustituye al material grabado con un equipo estereoscópico real, donde la segunda vista se fotografió de verdad en lugar de inferirse.
Buenas prácticas
Costumbres que dan un resultado mirable en lugar de un dolor de cabeza.
- Previsualiza un fotograma antes de convertir, y cógelo de la mitad del clip en vez del primero, que a menudo es un fundido o un rótulo
- Empieza en torno al 2% de intensidad y súbela solo hasta que la profundidad se lea con claridad: los artefactos crecen más rápido que el efecto
- Mira el mapa de profundidad cuando un resultado decepcione, porque una escena mal leída no se arregla con ningún control y te dice enseguida que pruebes con otro material
- Deja el plano de la pantalla en el extremo lejano salvo que tengas un motivo, ya que así todo queda delante de la pantalla y dentro de lo que tus ojos pueden fusionar
- Elige un tamaño por ojo pequeño para la visión paralela y míralo en un móvil, la única pantalla donde el límite de anchura se cumple con holgura
- Prueba primero la visión cruzada si esto es nuevo para ti, y pasa a la paralela cuando ya fusiones una imagen con fiabilidad
- Prefiere clips con un primer plano claro y un fondo real: las escenas planas, los primerísimos planos y el desenfoque de movimiento fuerte dan poco con lo que trabajar al modelo
- Recorta una grabación larga a la parte que quieres antes de convertir, ya que cada fotograma cuesta una estimación de profundidad lo conserves o no
- Mantén la pestaña en primer plano mientras corre una conversión, porque los navegadores frenan las pestañas de fondo y una tarea larga se alarga bastante
- Limita la cadencia a 30 con material de móvil grabado a 60, lo que reduce a la mitad el trabajo a cambio de un movimiento que nadie distinguirá en un par visto sin gafas
Limitaciones
Lo que esta herramienta no puede hacer, y dónde los resultados decepcionarán.
- El segundo punto de vista se infiere, no se fotografía. La profundidad se estima a partir de una sola imagen, y donde esa estimación falla la geometría falla con ella: esto no equivale a material grabado con dos cámaras.
- El modelo lee mal algunas escenas. Reflejos, cristal, imágenes impresas de escenas, superficies lisas con textura fuerte y el desenfoque de movimiento fuerte se leen todos de forma poco fiable. La vista previa del mapa de profundidad existe para que lo veas en lugar de adivinarlo.
- Las zonas ocultas tras los objetos hay que inventarlas. Nadie las filmó, así que el relleno es un estiramiento del fondo contiguo. Pasa desapercibido con intensidad moderada y es evidente con intensidad alta, sobre todo alrededor de objetos finos y el pelo.
- No es el efecto anamórfico de las pantallas LED curvas de exterior. Esa ilusión se construye para una geometría de pantalla y una posición de observación concretas y no puede deducirse de un vídeo plano, diga lo que diga cualquier aplicación.
- Ver sin gafas es una habilidad que se aprende. Bastantes personas no lo consiguen al principio, y algunas nunca lo encuentran cómodo. La cruzada es más fácil para la mayoría; un visor elimina el problema por completo.
- La visión paralela está limitada por el ancho de la imagen en tu pantalla, no por sus píxeles. Un par que se fusiona en un móvil puede ser imposible en un monitor a tamaño completo, y ningún ajuste de esta herramienta cambia eso: solo lo grande que lo muestres.
- El suavizado temporal reduce el parpadeo pero no puede eliminarlo. El movimiento rápido, los cortes dentro del clip y los cambios bruscos de luz seguirán mostrando algo de inestabilidad.
- Un corte dentro del original se trata como movimiento continuo, porque el clip se divide por tiempo y no por cambios de plano. La profundidad se mezcla brevemente a través del corte.
- La imagen siempre se recodifica. A diferencia de las herramientas de recorte y audio de aquí, cambia cada píxel, así que no hay vía de copia y una generación de compresión es inevitable.
- La salida mide el doble de ancho que el fotograma original, y los archivos son proporcionalmente mayores.
- El motor ocupa unos 31 MB y el modelo de profundidad otros 26 a 47 MB la primera vez. Después quedan en caché, pero un perfil de navegador nuevo carga con ambas descargas.
- Sin WebGPU el modelo recurre a la CPU y corre unas diez veces más lento, lo que hace poco práctico convertir clips largos en Safari y navegadores antiguos.
- La conversión va aproximadamente a tiempo real en una GPU, así que un vídeo de diez minutos tarda unos diez minutos con la pestaña abierta y delante. No hay cola ni procesado en segundo plano.
- Los fotogramas se mantienen en memoria durante un segmento, y WebAssembly es de 32 bits. Los fotogramas muy grandes se rechazan de entrada en lugar de dejar que fallen a medias, pero un archivo de origen grande sigue siendo un riesgo en un móvil.
Preguntas frecuentes
Preguntas que surgen al convertir vídeo plano a 3D.
¿Cómo convierto un vídeo 2D a 3D?
Añade el vídeo, elige si quieres un par paralelo o cruzado, fija el tamaño por ojo y pulsa Convertir. Un modelo de profundidad lee cada fotograma para deducir qué está cerca y qué lejos, y se construye un segundo punto de vista desplazando los píxeles lateralmente en proporción a su profundidad. El resultado es un MP4 corriente con dos imágenes lado a lado, una para cada ojo. Previsualiza antes un fotograma: la intensidad depende del plano concreto, y comprobarla en una imagen fija lleva segundos frente a los minutos de una conversión completa.
¿Necesito gafas 3D para ver el resultado?
No, y esa es la gracia. La salida es un par lado a lado que se ve apuntando los ojos, no filtrándolos. Cruza ligeramente la vista, o relájala como si miraras más allá de la pantalla, hasta que las dos mitades se superpongan en una tercera imagen central: esa del medio tiene relieve. Es cuestión de cogerle el punto más que un truco, y la mayoría lo consigue en unos minutos. El mismo archivo también se carga directamente en un visor de RV, si prefieres no aprender.
¿Qué diferencia hay entre visión paralela y cruzada?
Son dos formas de apuntar los ojos, y cada una necesita las mitades en un orden distinto. La paralela relaja los ojos hacia fuera, como mirando a través de la pantalla, y quiere la imagen del ojo izquierdo a la izquierda. La cruzada los dirige hacia dentro, delante de la pantalla, así que las mitades se intercambian. Ver un archivo del modo equivocado invierte la profundidad: el primer plano se hunde y el fondo flota, algo que se percibe raro sin ser obviamente raro, así que elige el modo antes de convertir.
¿Por qué no veo el efecto 3D en mi monitor?
Casi con seguridad porque la imagen es demasiado grande, y esto pilla a casi todo el mundo con la visión paralela. Para fusionar un par en paralelo tus ojos no pueden girar más hacia fuera que el frente, ya que el ojo humano no diverge, lo que limita la separación entre puntos correspondientes a unos 63 mm, la distancia entre tus pupilas. Cada mitad de un par a todo lo ancho en un monitor de 27 pulgadas mide unos 30 cm, así que no puede fusionarse. Reduce la ventana, échate atrás o míralo en un móvil. La visión cruzada no tiene ese límite y funciona a cualquier tamaño.
¿Se sube mi vídeo a algún sitio?
No. El motor de vídeo es FFmpeg compilado a WebAssembly y el modelo de profundidad corre sobre WebGPU o WebAssembly, ambos dentro de la pestaña. Tu archivo se lee del disco a la memoria de la pestaña y el vídeo terminado se escribe de vuelta como descarga. Lo único que se pide a la red son el motor y el modelo, una sola vez, y puedes confirmar que nada más se mueve mirando el panel de red durante una conversión.
¿Cuánto tarda una conversión?
En un equipo con WebGPU, más o menos a tiempo real: un clip de un minuto tarda alrededor de un minuto, uno de diez unos diez. Hay que estimar la profundidad en cada fotograma y eso domina todo lo demás. Sin WebGPU el modelo recurre a la CPU y va unas diez veces más lento, lo que resulta llevadero en un clip corto y poco práctico en uno largo. La barra de progreso da una estimación medida del rendimiento real en lugar de predicha, así que se vuelve fiable en los primeros segundos.
¿Hay un límite de duración?
No. El clip se convierte por segmentos, cada uno extraído, convertido, codificado y descartado antes de empezar el siguiente, así que la memoria depende del tamaño de un fotograma y no de la duración del vídeo. Lo que te limita en la práctica es la paciencia y mantener la pestaña abierta, no un tope en la herramienta. Los fotogramas muy grandes son otra cosa: esos se rechazan de entrada con una nota para que elijas un tamaño por ojo menor, en lugar de dejar que fallen a medio camino.
¿Por qué el 3D se ve mal en algunos vídeos?
Normalmente porque el modelo leyó mal la escena, y la vista previa del mapa de profundidad te lo mostrará exactamente. Reflejos, cristal, superficies lisas con textura fuerte, fotografías impresas dentro del plano y el desenfoque de movimiento fuerte se leen de forma poco fiable, y ningún ajuste de intensidad se recupera de un mapa equivocado. Las escenas con un primer plano claro y un fondo real —paisajes, tomas de dron, una persona en una habitación— se convierten mucho mejor que las planas o recargadas.
¿Qué son las manchas alrededor de los objetos?
Desplazar píxeles lateralmente para construir el segundo ojo deja al descubierto zonas que estaban ocultas tras objetos más cercanos, y como nunca se filmaron hay que inventarlas. Cada hueco se rellena desde el lado del fondo, que es donde pertenece realmente el contenido que falta, pero un parche sigue siendo un parche. Crece con la intensidad, y ese es el motivo principal de que los valores moderados suelan verse mejor que los fuertes. Los objetos finos y el pelo son los casos más difíciles.
¿Puede hacer el efecto 3D anamórfico de las pantallas gigantes de exterior?
No, y nada puede a partir de un vídeo plano. Esas pantallas funcionan renderizando una escena con la distorsión de perspectiva que necesita una pantalla curva concreta y una posición de observación concreta: la ilusión vive en la geometría de la pantalla y en dónde te sitúas respecto a ella. Esa información no existe en ninguna parte de un vídeo corriente, así que no puede recuperarse de él. Esta herramienta hace pares estereoscópicos, que es otro efecto con otro mecanismo.
¿Funciona con vídeo vertical de móvil?
Sí. Las fuentes verticales conservan su orientación, y la rotación registrada en el archivo se tiene en cuenta: un clip grabado en vertical se trata como vertical en lugar de informarse como un fotograma apaisado tumbado. El par resultante son dos fotogramas verticales lado a lado, bastante ancho en conjunto pero muy adecuado para ver sin gafas precisamente porque cada mitad se mantiene estrecha.
¿Qué pasa con el audio?
La primera pista de audio se multiplexa en una sola pasada al final en vez de partirla y volver a unirla en cada segmento, y es deliberado: cortar el audio en cada límite es por donde se cuela el desfase. Cuando el contenedor de salida puede transportar la pista tal cual, se copia sin recodificar; si no, pasa a AAC. Solo sobrevive esa primera pista: las demás pistas de idioma y los subtítulos no se conservan. Como la conversión no altera ningún tiempo, el sonido encaja donde estaba, y una fuente sin sonido se maneja sin quejas.
Herramientas relacionadas
Más herramientas locales, solo de navegador, para trabajar con vídeo.