Conversor de fotos a 3D
Convierte una foto corriente en algo que puedes ver en tres dimensiones. Un modelo de profundidad lee la imagen y a partir de ella se construye un segundo punto de vista, que luego se convierte en un par lado a lado para ver sin gafas, en un anaglifo rojo-cian para gafas de color, en un GIF wiggle que no necesita ninguna de las dos cosas, o en el propio mapa de profundidad. Todo ocurre en tu pestaña; la foto no se sube a ningún sitio.
- Cuatro salidas de una sola estimación de profundidad — lado a lado, anaglifo, animación wiggle y mapa de profundidad — y cada control redibuja la vista previa mientras lo mueves
- El wiggle no necesita gafas ni saber ver en paralelo, así que es la única salida que no le pide nada a quien se la enseñes
Suelta aquí tu foto
Se queda en tu equipo y nunca se sube
Lee JPEG, PNG, WebP, AVIF, GIF y BMP; de un GIF animado se toma el primer fotograma. Se aplica la rotación que registró la cámara, así que una foto vertical entra derecha.
Añade una foto para empezarSirve cualquier foto 2D corriente. La profundidad se deduce de la propia imagen, así que no hace falta ninguna cámara especial.
Resumen
Qué hace la herramienta con una foto plana, y por qué está cada pieza.
- 01
Profundidad a partir de una sola fotografía
Un modelo neuronal de profundidad mira la imagen y estima la profundidad relativa de cada píxel: no una medida de distancia, sino un orden de qué está delante de qué. Lee las mismas pistas que lee una persona en una fotografía: oclusión, perspectiva, gradiente de textura, tamaño relativo. Eso es lo que permite usar una instantánea corriente como material de partida en vez de exigir una cámara estereoscópica.
- 02
Un segundo punto de vista sintetizado
El mapa de profundidad impulsa un desplazamiento horizontal: los píxeles cercanos se mueven más que los lejanos, que es exactamente lo que separa las dos imágenes que reciben tus ojos en el mundo real. Ambas vistas se desplazan la mitad del total en lugar de dejar una quieta, así que el encuadre sigue centrado y cada vista abre solo la mitad de zona oculta.
- 03
Cuatro salidas de una sola pasada
El modelo se ejecuta una vez por foto y todo lo posterior es aritmética, así que lado a lado, anaglifo, wiggle y mapa de profundidad salen de la misma estimación sin coste añadido. Por eso también cada control actualiza la imagen mientras lo arrastras, en lugar de pedirte que vuelvas a ejecutar y esperes.
- 04
Anaglifo hecho como es debido
Siete métodos, incluida la proyección por mínimos cuadrados de Dubois tanto para rojo-cian como para verde-magenta. En vez de asignar canales a ojos, resuelve qué par de imágenes se parece más a la original una vez contabilizada la fuga de cada filtro, que es la razón de que los rojos dejen de convertirse en agujeros negros. Un control de intensidad de color y un intercambio de ojos cubren las dos cosas que más suelen salir mal.
- 05
Un wiggle que no necesita nada
La animación se balancea entre puntos de vista, así que el movimiento aporta la paralaje que normalmente aportan dos ojos. Sin gafas, sin destreza que aprender, y sobrevive a publicarse en cualquier parte. El bucle está construido para que sus puntos de giro no se dupliquen, que es lo que evita el tirón por vuelta que produce un barrido ingenuo, y se recortan los bordes que las vistas extremas tuvieron que inventar.
- 06
Bordes de profundidad ajustados a la imagen
El modelo trabaja en torno a 518 píxeles, así que sus límites de profundidad llegan blandos y ligeramente desplazados del objeto, que es lo que pone un halo de fondo alrededor del sujeto. Un filtro sensible a bordes vuelve a promediar la profundidad usando los bordes de la propia fotografía como guía, de modo que la profundidad deja de cruzar un límite que la imagen ya conoce.
- 07
Relleno de huecos que usa el fondo
Desplazar píxeles lateralmente deja al descubierto zonas que la cámara nunca registró, siempre en los bordes de los objetos más cercanos. Cada hueco se tapa desde el lado que está más lejos, porque eso es a lo que pertenece la zona que falta, y el fondo se refleja hacia dentro para que la textura continúe en vez de convertirse en una franja plana.
- 08
La cuestión del tamaño, resuelta en pantalla
Que un par en paralela pueda fusionarse depende de lo ancho que se dibuje, no de sus dimensiones en píxeles, y eso descoloca a casi todo el mundo. La vista previa tiene un control de tamaño con una estimación del ancho físico de cada mitad, además de un botón que la mete de inmediato dentro del límite aproximado de 63 mm.
Cómo usarla
De una foto plana a algo que puedes ver en 3D.
- 01
Añade una foto. Sirve cualquier imagen 2D corriente: una instantánea del móvil, un escaneo, una descarga. Nada sale de tu navegador.
- 02
Pulsa Generar 3D. El modelo de profundidad se descarga la primera vez y luego lee la foto, lo que tarda unos segundos.
- 03
Elige qué quieres crear. Elige Wiggle si buscas algo fácil de compartir; anaglifo si tienes gafas de color; lado a lado para ver sin gafas, o lado a lado en orden Paralela para un visor; mapa de profundidad si lo va a usar otro programa.
- 04
Ajusta la intensidad 3D hasta que la profundidad se lea con claridad sin manchas en los bordes de los objetos. La vista previa se actualiza mientras arrastras.
- 05
Fija el plano de pantalla. Para lado a lado déjalo en cero para que todo flote hacia ti; para anaglifo y wiggle ponlo sobre tu sujeto.
- 06
Mira la vista del mapa de profundidad si un resultado decepciona. Claro es cerca, oscuro es lejos. Una escena mal interpretada se ve mucho más claramente ahí que en el resultado.
- 07
Para lado a lado, usa el control de tamaño bajo la vista previa hasta que cada mitad mida unos 63 mm, y entonces relaja o cruza los ojos.
- 08
Pulsa Descargar. Las salidas fijas se guardan como PNG, JPEG o WebP; el wiggle se codifica como GIF animado en ese momento.
Detalles
Los detalles que deciden si el resultado es algo que puedes ver de verdad.
- Estimación monocular de profundidad sobre la propia foto, así que una instantánea corriente es material válido sin cámara estereoscópica de por medio
- Salida lado a lado en orden paralelo o cruzado; los visores de fotos en VR suelen esperar el orden paralelo
- Siete métodos de anaglifo, incluida la proyección por mínimos cuadrados de Dubois para rojo-cian y para verde-magenta
- Control de intensidad de color e intercambio de izquierda y derecha, que cubren las dos causas más frecuentes de que un anaglifo no fusione
- Salida wiggle animada como GIF, sin necesidad de gafas ni de ninguna destreza para ver sin ellas
- Número de fotogramas, velocidad y curva de movimiento del wiggle, con un bucle cuyos puntos de giro no se duplican para que no dé tirones
- Recorte automático de la franja inventada en el borde del wiggle, donde un parche cambiante llamaría la atención
- Exportación del mapa de profundidad en escala de grises o en tres rampas de color, con inversión para programas que esperan lo cercano oscuro
- Refinado de profundidad guiado por los bordes de la fotografía, que elimina la mayor parte del halo alrededor de los sujetos
- Ambas vistas desplazadas la mitad del total, de modo que el encuadre sigue centrado y cada vista abre solo la mitad de la zona oculta
- Huecos tapados desde el lado lejano de cada borde y reflejados hacia dentro, en lugar de arrastrados desde el primer plano
- Vista previa en vivo: el modelo se ejecuta una vez por foto y todos los controles posteriores redibujan al instante
- Control de tamaño en pantalla con estimación del ancho físico, que es la respuesta real a «por qué no lo veo»
- PNG, JPEG o WebP para las salidas fijas con control de calidad, y GIF animado para el wiggle
- Todo se ejecuta en la pestaña del navegador: sin subidas, sin cola, sin cuenta y sin marca de agua
Casos de uso
Por qué se quiere convertir una foto plana en una imagen estereoscópica.
-
Hacer un wigglegram para publicar
El wiggle es el formato 3D más fácil de compartir en un feed: sin gafas y sin nada que aprender. Antes hacían falta cámaras de película de varios objetivos, y había que planificar la toma de antemano. Esto lo construye a partir de una foto que ya tienes.
-
Fotos antiguas y escaneos
Las fotos de familia, las copias de archivo y cualquier imagen anterior a la captura estereoscópica son planas por naturaleza y no se pueden repetir. La estimación de profundidad es la única vía para darles un segundo punto de vista, y el resultado se puede mirar sin comprar nada.
-
Anaglifos para una sala llena de gente
Ver sin gafas es una destreza individual que no todo el mundo tiene. Un paquete de gafas de cartón rojo-cian cuesta casi nada y permite que una sala entera vea la misma imagen a la vez, y por eso el anaglifo sigue siendo el formato de un aula, una charla o una página impresa.
-
Mapas de profundidad para otros programas
Los efectos de paralaje en la web, el desplazamiento en un paquete 3D, el enfoque y la reiluminación en composición y la generación de imágenes condicionada por profundidad piden todos un mapa de profundidad y rara vez lo traen. Exportarlo aquí es a menudo el motivo entero para abrir la herramienta.
-
Fotos para un visor de VR
Los visores de fotos suelen admitir imágenes lado a lado. Elige Paralela en esta herramienta y, si el visor lo pide, configura lado a lado y el orden de los ojos: el archivo no lleva metadatos estereoscópicos. El mismo par también se puede ver sin gafas en un móvil.
-
Paisajes, retratos y fotos de producto
Las escenas con un primer plano claro y un fondo real se convierten mucho mejor que las planas o abarrotadas. Un paisaje con distancia por capas, una persona contra una habitación o un solo objeto sobre una superficie lisa se acercan al caso ideal: estructura de profundidad inequívoca, bordes limpios y poco que inventar detrás.
-
Enseñar cómo funciona la visión estereoscópica
Poder convertir una foto y luego poner el mapa de profundidad al lado hace visible el mecanismo de un modo que un diagrama no consigue. Los casos que fallan enseñan tanto como los que salen bien, y alternar entre anaglifo, lado a lado y wiggle muestra tres respuestas distintas al mismo problema.
-
Imágenes que no pueden salir de tu equipo
Las fotos familiares, el trabajo de cliente y cualquier cosa sujeta a un acuerdo no pintan nada en el servidor de otro por probar un efecto. El procesamiento se queda en la pestaña: solo se descarga el modelo de profundidad; la foto no sale de tu equipo.
Ver también
El modelo lee el encuadre que le des, así que recorta y endereza antes de convertir en vez de después, y de eso se encarga Recortar imagen. Las fotografías muy grandes cuestan memoria de descodificación sin mejorar la estimación de profundidad, y reducir una a un tamaño razonable primero es para lo que está Redimensionador de imágenes. La misma conversión aplicada a un vídeo en lugar de a un solo fotograma, con procesado por segmentos y el audio conservado, es Conversor 3D estereoscópico.
Cómo funciona de verdad el 3D sin gafas
El mecanismo de cada salida y las restricciones que deciden si puedes verlo.
-
Dos imágenes, una para cada ojo
Todo el 3D estereoscópico funciona igual: muestra a cada ojo una vista ligeramente distinta de la misma escena y el cerebro las fusiona en profundidad. El cine usa gafas polarizadas para repartir las dos imágenes; un visor usa dos pantallas; un anaglifo usa el color. Ver sin gafas se salta el aparato por completo haciendo que apuntes los ojos de modo que cada uno caiga sobre su mitad de un par lado a lado.
-
Paralela frente a cruzada
Son dos maneras de apuntar. En la visión paralela los ojos se relajan hacia fuera como si miraran más allá de la pantalla, y la imagen izquierda va a la izquierda. La visión cruzada los dirige hacia dentro, delante de la pantalla, así que las mitades se intercambian. El mismo archivo no sirve para las dos: mirado del modo equivocado, la profundidad se invierte y la imagen se voltea sin dejar de parecer convincentemente tridimensional.
-
Por qué el tamaño importa en la visión paralela
Para fusionar un par en paralela tus ojos no pueden girar más hacia fuera que al frente, porque el ojo humano no diverge. Eso limita a unos 63 mm la separación entre puntos correspondientes, la distancia entre tus pupilas. En un móvil es fácil. En un monitor grande con el par a todo lo ancho, cada mitad mide decenas de centímetros y fusionarla es sencillamente imposible, sea cual sea la resolución.
-
Lo que un anaglifo sacrifica
Los filtros de color pueden separar dos imágenes porque cada uno deja pasar lo que el otro bloquea, pero ningún filtro real es perfecto, así que parte de cada vista se cuela en el ojo equivocado como fantasma. Peor aún: un objeto rojo saturado resulta brillante para un ojo y negro para el otro, y el cerebro se niega a fusionar eso. Es la rivalidad retiniana, y la razón principal de que los anaglifos baratos resulten incómodos. Cada método de aquí es una respuesta distinta a ese intercambio.
-
Por qué el wiggle funciona sin nada
La estereoscopía no es tu única pista de profundidad. La paralaje de movimiento — lo cercano cruzando tu vista más rápido que lo lejano — funciona con un ojo cerrado, y es la razón de que inclinarte hacia un lado te diga qué está delante de qué. Una animación que se balancea entre dos puntos de vista te entrega esa pista directamente, y por eso un wiggle se lee como profundidad incluso para quien no sabe ver en paralela y no lleva nada puesto.
-
De dónde salen los artefactos
Dos cosas limitan cualquier conversión basada en profundidad. El modelo puede interpretar mal una escena — un cartel leído como una ventana, un reflejo leído como distancia — y de eso no se recupera ningún ajuste, que es la razón de mirar el mapa de profundidad. Y desplazar píxeles lateralmente descubre fondo que nunca se fotografió, así que hay que inventarlo. Ambas cosas empeoran al subir la intensidad, y por eso los ajustes moderados suelen verse mejor.
Buenas prácticas
Hábitos que dan un resultado que merece la pena mirar.
- Empieza por el wiggle si vas a enseñárselo a alguien, porque es la única salida que no le pide nada a la otra persona
- Mantén moderada la intensidad 3D y súbela solo hasta que la profundidad se lea con claridad: los artefactos crecen más deprisa que el efecto
- Mira el mapa de profundidad cuando un resultado decepcione, porque una escena mal interpretada no la arregla ningún control y te dice al momento que pruebes otra foto
- Pon el plano de pantalla sobre tu sujeto para anaglifo y wiggle, y déjalo en cero para ver en paralela
- Prueba Dubois antes que cualquier otro método de anaglifo, y recurre a la intensidad de color en vez de a otro método cuando vibren los rojos fuertes
- Intercambia los ojos si un anaglifo parece tridimensional pero equivocado, porque las gafas se llevan del revés más a menudo de lo que nadie admite
- Usa el control de tamaño en pantalla con los pares en paralela en lugar de dar por hecho que el efecto está roto, porque el ancho en pantalla es lo que decide si fusiona
- Prueba primero la visión cruzada si esto es nuevo para ti, y pasa a la paralela cuando fusiones con soltura
- Prefiere fotografías con un primer plano claro y un fondo real: las escenas planas, los primeros planos muy cerrados y el movimiento borroso dan poco con lo que trabajar al modelo
- Mantén pequeña la salida del wiggle: un GIF guarda cada fotograma entero, así que el ancho cuesta aquí mucho más que en una imagen fija
- Guarda los mapas de profundidad como PNG, porque los artefactos de compresión en un mapa de profundidad se vuelven geometría errónea en cuanto otro programa lo lee
- Recorta y endereza antes de convertir en vez de después, para que el modelo vea el encuadre que de verdad vas a usar
Limitaciones
Lo que esta herramienta no puede hacer, y dónde los resultados decepcionarán.
- El segundo punto de vista es inferido, no fotografiado. La profundidad se estima desde una sola imagen, y donde esa estimación falla la geometría falla con ella: esto no equivale a una toma hecha con una cámara estereoscópica.
- El modelo interpreta mal algunas escenas. Reflejos, cristal, imágenes impresas de escenas, superficies planas con textura fuerte y movimiento muy borroso se leen de forma poco fiable. La vista del mapa de profundidad existe para que lo veas en vez de adivinarlo.
- Las zonas ocultas detrás de los objetos hay que inventarlas. Nada las fotografió, así que el relleno es un reflejo del fondo vecino. Pasa desapercibido con intensidades moderadas y se nota con las altas, sobre todo alrededor de objetos finos y del pelo.
- Ver sin gafas es una destreza que se aprende. Bastante gente no lo consigue al principio y algunos nunca llegan a estar cómodos. A la mayoría le resulta más fácil la visión cruzada; el anaglifo y el wiggle eliminan el problema por completo.
- La visión paralela está limitada por el ancho de la imagen en tu pantalla, no por sus dimensiones en píxeles. Un par que fusiona en un móvil puede ser imposible en un monitor a tamaño completo, y ningún ajuste de aquí cambia eso: solo lo grande que lo muestres.
- Los anaglifos siempre cuestan fidelidad de color, y ningún método elimina el fantasma del todo. Los rojos y verdes intensos son los casos más difíciles, y una imagen dominada por un solo tono saturado puede no verse bien con ningún método.
- El wiggle es un GIF, así que está limitado a 256 colores y engorda deprisa. El tramado oculta las bandas pero añade ruido que varía entre fotogramas, y ninguna de las dos opciones sale gratis.
- La profundidad es relativa, no medida. Los valores dicen qué está delante de qué dentro de esa única imagen, sin escala absoluta, y dos fotos de la misma escena no coincidirán en sus números.
- El mapa de profundidad es de 8 bits, así que tiene 256 niveles distinguibles. Sobra para paralaje y máscaras, y no basta para trabajo de desplazamiento preciso.
- No es la ilusión anamórfica de las pantallas LED curvas de exterior. Aquella se construye para una geometría de pantalla y una posición de observación concretas y no puede deducirse de una foto plana, diga lo que diga una aplicación.
- Los metadatos no se conservan. La salida se dibuja en un lienzo, así que EXIF, perfiles de color y etiquetas GPS se quedan atrás, lo cual es cómodo para la privacidad y una pérdida si los querías.
- Las fotos de gama amplia y HDR pasan por el lienzo normal del navegador, así que salen en rango dinámico estándar y sRGB.
- El modelo de profundidad ocupa entre 26 y 47 MB la primera vez, según si tu navegador tiene WebGPU. Después queda en caché, pero un perfil de navegador nuevo vuelve a descargarlo.
- Una foto cada vez. No hay modo por lotes, porque los ajustes que dan un buen resultado son juicios sobre una imagen concreta y no algo que aplicar a ciegas a una carpeta.
Preguntas frecuentes
Preguntas que surgen al convertir fotos en imágenes 3D.
¿Cómo convierto una foto 2D en una imagen 3D?
Añade la foto y pulsa Generar 3D. Un modelo de profundidad lee la imagen para deducir qué está cerca y qué está lejos, y se construye un segundo punto de vista desplazando los píxeles lateralmente en proporción a su profundidad. Después eliges qué hacer con ello: un par lado a lado que se mira apuntando los ojos, un anaglifo rojo-cian para gafas de color, un wiggle animado que no necesita ninguna de las dos cosas, o el propio mapa de profundidad. El modelo se ejecuta una sola vez, así que a partir de ahí cada control actualiza la vista previa mientras lo arrastras y puedes probar las cuatro salidas sin esperar.
¿Necesito gafas 3D?
Solo para el anaglifo. La salida wiggle no necesita absolutamente nada: se anima entre los dos puntos de vista, y ese movimiento le da a tu cerebro la misma pista de profundidad que inclinarte hacia un lado, por lo que sigue leyéndose como profundidad para quien ve con un solo ojo. El par lado a lado tampoco necesita aparatos, pero sí saber ver sin gafas, una destreza que unos cogen en minutos y otros nunca llegan a encontrar cómoda. Si quieres darle una foto 3D a otra persona sin instrucciones, usa el wiggle.
¿Cómo hago un wigglegram a partir de una foto?
Elige la salida Wiggle después de generar la profundidad. Un wigglegram es una animación que se balancea entre puntos de vista ligeramente distintos de la misma escena, y originalmente requería una cámara de película con varios objetivos colocados uno al lado del otro. Aquí los puntos de vista extra se sintetizan desde el mapa de profundidad, así que basta con una foto corriente. Fija el número de fotogramas — dos da la alternancia clásica y seca, más dan un movimiento suave —, elige una velocidad de entre 10 y 14 fotogramas por segundo y descarga un GIF animado. La vista previa se anima en vivo con los ajustes que elijas, así que puedes juzgarlo antes de codificar nada.
¿Cuál es el mejor método de anaglifo para gafas rojo-cian?
Dubois, en casi todos los casos. El enfoque evidente es dar el canal rojo a un ojo y el verde y el azul al otro, pero los filtros reales dejan pasar luz, y entonces un objeto rojo saturado se ve brillante para un ojo y negro para el otro: el cerebro se niega a fusionar eso, y de ahí viene la incomodidad de los anaglifos baratos. Dubois resuelve en cambio qué par de imágenes se acerca más a la original vista a través de filtros reales, así que los rojos sobreviven y el fantasma prácticamente desaparece. Si una imagen sigue vibrando, baja la intensidad de color antes de probar otro método; la escala de grises y el monocromo eliminan el problema del todo a costa de todo el color.
¿Se sube mi foto a algún sitio?
No. El modelo de profundidad se ejecuta mediante WebGPU o WebAssembly dentro de la pestaña de tu navegador, y todos los demás pasos son aritmética sobre un lienzo. Tu foto se lee del disco a la memoria de la pestaña y la imagen terminada se escribe de vuelta como descarga. La primera vez se descarga el propio modelo desde la red, pero tu foto y el resultado generado nunca se suben.
¿Por qué el 3D se ve mal o del revés?
Tres causas habituales, por orden de probabilidad. Primera: las gafas están al revés, o el par lado a lado se está mirando con la técnica equivocada. Ambas cosas invierten la profundidad, y una imagen invertida sigue pareciendo convincentemente tridimensional, así que es fácil pasarlo por alto. Usa el control de intercambio para los anaglifos, o alterna entre paralela y cruzada. Segunda: el modelo interpretó mal la escena, y la vista del mapa de profundidad te lo mostrará al instante; reflejos, cristal e imágenes impresas dentro de la toma son los culpables habituales, y de un mapa erróneo no se recupera ningún ajuste. Tercera: la intensidad es simplemente demasiado alta, lo que se lee como manchas alrededor de los objetos y no como profundidad.
¿Puedo obtener un mapa de profundidad de una foto?
Sí: elige la salida Mapa de profundidad y descárgala. Para otro programa, selecciona Escala de grises y PNG: obtendrás un mapa de 8 bits al tamaño elegido, alineado píxel a píxel con la foto escalada, donde por defecto claro significa cerca, y con una inversión para los programas que esperan lo contrario. JPEG, WebP y las tres rampas de color sirven para compartir o inspeccionar el mapa, no para geometría. Es profundidad relativa: te dice qué está delante de qué dentro de esa única imagen, no a qué distancia en metros está nada. Eso es lo que necesitan los efectos de paralaje, el desplazamiento, las máscaras por distancia y la generación de imágenes condicionada por profundidad.
¿Cuál es la diferencia entre visión paralela y cruzada?
Son dos maneras de apuntar los ojos, y cada una necesita las mitades en un orden distinto. La visión paralela relaja los ojos como si miraras a través de la pantalla, y quiere la imagen del ojo izquierdo a la izquierda. La visión cruzada los dirige hacia dentro, delante de la pantalla, así que las mitades se intercambian. A la mayoría le resulta más fácil aprender la cruzada. Evita el límite de divergencia de la paralela, aunque un tamaño moderado sigue siendo más cómodo. La paralela puede resultar más cómoda cuando la coges, pero tiene un límite de tamaño tajante porque tus ojos no pueden girar más hacia fuera que al frente.
¿Por qué no veo el efecto lado a lado en mi monitor?
Casi con toda seguridad porque la imagen se está dibujando demasiado grande, y esto descoloca a casi todo el mundo con la visión paralela. Fusionar un par en paralela exige que tus ojos no giren más hacia fuera que al frente, ya que el ojo humano no diverge, lo que limita la separación entre puntos correspondientes a unos 63 mm: la distancia entre tus pupilas. Cada mitad de un par a todo lo ancho en un monitor grande mide decenas de centímetros, así que no se puede fusionar a ninguna resolución. El control de tamaño bajo la vista previa existe para esto: redúcelo hasta que cada mitad mida unos 63 mm, o pulsa el botón de ajuste. La visión cruzada evita ese límite de divergencia, aunque un tamaño moderado sigue siendo más cómodo.
¿Qué fotos se convierten mejor?
Las que tienen un primer plano claro, un plano medio distinto y un fondo real: un paisaje con distancia por capas, una persona contra una habitación, un solo objeto sobre una superficie lisa. Esas le dan al modelo pistas inequívocas y dejan poco que inventar detrás de los bordes. Lo que se convierte mal es todo lo plano o ambiguo: una fotografía de una fotografía, una pared de texto, el movimiento muy borroso, los reflejos grandes, el cristal y las tomas donde sujeto y fondo tienen el mismo brillo y la misma textura. Los primeros planos muy cerrados también tienen poca estructura de profundidad, así que el efecto queda sutil con cualquier intensidad.
¿Qué son el halo y las manchas alrededor de los objetos?
Son dos cosas distintas. Desplazar píxeles lateralmente para construir un segundo punto de vista descubre zonas que estaban ocultas detrás de objetos más cercanos, y nada las fotografió nunca, así que hay que inventarlas: cada hueco se tapa desde el lado del fondo y se refleja hacia dentro, pero un parche sigue siendo un parche, y crece con la intensidad. Por separado, el modelo trabaja a una resolución mucho menor que tu foto, así que sus bordes de profundidad llegan blandos y ligeramente desplazados del objeto, lo que deja una franja de fondo a la profundidad equivocada alrededor de cabezas y hombros. El ajuste de bordes apunta precisamente a lo segundo.
¿Funciona en el móvil?
Sí, y un móvil es la mejor pantalla para mirar el resultado: es el único dispositivo donde un par lado a lado en paralela entra con holgura en el límite de ancho, así que ver sin gafas resulta mucho más fácil ahí que en un monitor de escritorio. Generar la profundidad es más lento en un móvil que en un escritorio con WebGPU, pero se trata de una foto y no de miles de fotogramas, así que sigue siendo cuestión de segundos. Mantén moderado el ancho de salida en móvil: la estimación de memoria que aparece antes de generar te avisará cuando los ajustes pidan demasiado.
Herramientas relacionadas
Más herramientas locales, solo de navegador, para trabajar con imágenes.