
Aunque en la actualidad es bastante común que se lancen al mercado productos tecnológicos de alto perfil, no lo es tanto que estos abran nuevas posibilidades. Para muchos, la gran cantidad de cascos de realidad mixta y realidad virtual son el mayor indicador de una nueva era.
Han pasado ya varios años desde que Apple lanzó su producto estrella en este segmento. El Vision Pro sigue siendo uno de los dispositivos más caros del mercado, y hay quien opina que no está a la altura de su precio.
Para nosotros, un nuevo software de Apple podría ser la clave para descubrir un uso real para este dispositivo. Se trata de un nuevo modelo de código abierto que puede convertir fotos en 2D en imágenes en 3D.
Conocido como "SHARP", el modelo predice cómo sería una representación en 3D de la escena, basándose en los puntos de vista dentro de la imagen. Sin entrar en demasiados detalles, descodifica la profundidad de ciertos elementos de la imagen y los utiliza como puntos de referencia dentro de la escena en 3D.
La gran diferencia de la tecnología de Apple es que puede producir una representación completa en 3D a partir de una sola imagen. Otras herramientas de esta clase necesitan cientos de imágenes de la misma escena para producir una representación aceptable.
Contar con un sistema de una sola toma significa que los usuarios pueden manipular muchas imágenes con facilidad, lo que hace que el proceso sea más sencillo que nunca.
New paper from Apple - Sharp Monocular View Synthesis in Less than a Second
— Tim Davison ᯅ (@timd_ca) December 16, 2025
Mescheder et al. @ Apple just released a very impressive paper (congrats! 🎉🥳). You give it an image and it generates a really great looking 3d Gaussian representation. Uses depth pro. It's really good.… pic.twitter.com/XSZCZA8iio
Cuando leímos por primera vez sobre esta tecnología, nos quedamos un poco indiferentes. Claro, suena interesante, pero ¿quién la usaría realmente?
Luego vimos imágenes de los modelos en unos Apple Vision Pro y, de repente, todo cobró sentido. De pronto, se podía interactuar con las imágenes capturadas como instantáneas de un momento concreto y moverse a través de ellas.
Aunque el diseño tiene limitaciones evidentes (por ejemplo, no genera más allá de los límites de la imagen), el efecto general es muy bueno y añade una nueva capa de profundidad a las imágenes viejas.