Sorpresa: escondido dentro de Pi hay un sistema de almacenamiento infinito

Cualquiera que navegue entre curiosidades informáticas tarde o temprano encontrará PiFSEl «sistema de archivos sin contenido”Descrito por primera vez en 1999. Steve Steinberg Imagínelo como un sistema donde el sistema de almacenamiento (SSD) ya no contiene los archivos reales, sino solo dos numeros: el desplazamiento dentro de los dígitos de pi donde comienza la secuencia buscada y su longitud.

Intentemos entenderlo de otra manera. Cualquier archivo es, desde el punto de vista de la computadora, una secuencia de números, que se puede expresar de diferentes maneras (base dos, base diez, base dieciséis y así sucesivamente). Si hay letras y otros glifos no es crucial porque la codificación de todos los diferentes tipos de alfabeto se produce de una manera acordada con Unicode, que asigna valores numéricos a los caracteres; codificaciones como UTF-8 convierten esos valores en secuencias de bytes.

Entonces, si cada archivo de computadora es solo una secuencia de números X de una longitud determinada Y (la longitud del archivo), el problema es encontrar dentro de la sucesión infinita de números de Pi (3,14 y hasta el infinito con los demás decimales) dónde empieza y termina el segmento con la secuencia correcta.

La premisa matemática se cumple: se conjetura que Pi es un número normales decir, una secuencia en la que cada cadena finita de dígitos aparece tarde o temprano con una frecuencia uniforme. Si la conjetura es ciertacada archivo creado, eligiendo cualquier base numérica, ya existe en algún lugar dentro de los infinitos dígitos después del punto decimal.

Dicho de otra manera: “dentro” de Pi (que al ser una constante se define matemáticamente, aunque nunca se explora realmente en profundidad porque nadie puede saber todos los dígitos) existen todos los archivos posibles del mundo con todas sus posibles variaciones. Más o menos como La biblioteca infinita de Borgesexcepto que no necesitas la biblioteca, todo lo que necesitas es la constante matemática que representa la relación entre la longitud de una circunferencia y su diámetro.

Almacenar en abstracción

De esa premisa nació el proyecto de código abierto. πfspublicado en GitHub y todavía disponible hoy, que implementa la idea de manera divertida utilizando la fórmula de Bailey-Borwein-Plouffe para calcular dígitos hexadecimales únicos de Pi sin tener que generar todos los anteriores. El archivo nunca se mueve ni se copia: permanece «dentro» de la constante y el disco sólo guarda las coordenadas para encontrarlo. Es almacenamiento, parece gratisporque Pi es un bien común, calculable por cualquier persona, en cualquier lugar, sin necesidad de transferir un solo byte de datos reales.

¿Pero entonces es verdad? ¿Obras? Lo hermoso de la informática es que no sólo nos ofrece este tipo de hipótesis paradójicaspero también nos ofrece inmediatamente la razón por la que no son posibles.

De hecho, el problema surge en cuanto intentas utilizarlo en archivos de tamaño concreto, y aquí la historia deja de ser sólo un juego. Para identificar una secuencia específica y lo suficientemente larga dentro de Pi, en promedio es necesario profundizar mucho, ed. exponencialmente Más en profundidad cuanto más larga sea la secuencia y libre de repeticiones internas. El offset necesario, expresado en bits, acaba siendo tan grande como el archivo mismosi no más. Los propios desarrolladores lo confirman. πfs en la documentación, donde irónicamente admiten que el sistema funciona bien, siempre y cuando no esperes que comprima nada.

El principio que PiFS niega por diversión

Detrás del chiste se esconde un resultado grave de la teoría de la información: ningún algoritmo puede comprimir todos archivos posibles, porque los punteros cortos disponibles son siempre menos que los archivos que deberían indexar. Es el principio de conteo aplicado a la compresión, el mismo que hace imposible un archivo universal a coste cero, en Pi como en cualquier otra secuencia infinita y normal.

En Noticias de piratas informáticosdonde PiFS reaparece periódicamente en los debates, los usuarios que lo han implementado informan del mismo resultado: el desplazamiento necesario para transmitir datos reales era sistemáticamente más caro en términos de espacio y cálculo de los datos en sí.

La misma intuición se puede comprobar de primera mano. Página de búsqueda de Pi, sitio que le permite buscar una secuencia dentro de los primeros cien millones de dígitos de Pi. Escribe el tuyo cumpleaños casi siempre devuelve un resultado inmediato, porque las secuencias cortas aparecen temprano y, a menudo, a lo largo de la constante.

Probar una frase completa, o algo más largo que un puñado de dígitos, lo cambia todo: la posición solicitada crece dramáticamentey el número necesario para indicarlo se vuelve engorroso. Es la misma ilusión que PiFS, reducida a escala de demostración y accesible desde cualquier navegador.

Si bien la fantasía del almacenamiento infinito sigue confinada a repositorios que parecen historias de ciencia ficción, la demanda real de capacidad nunca ha dejado de crecer, impulsada hoy sobre todo por las cargas de trabajo generativas de inteligencia artificial. Según las últimas previsiones sobre el mercado del disco duro, elarchivar Se espera que el crecimiento global sea constante hasta 2029, y los discos duros mecánicos siguen dominando para grandes volúmenes a pesar del avance de los SSD en cargas más intensivas. Los fabricantes continúan persiguiendo densidades cada vez mayores y precios por terabyte cada vez más bajos. Los caminos que PiFS había intentado, por diversión, evitar por completo.

Sorpresa: dentro de Pi se esconde un sistema de almacenamiento infinito - macitynet.it

¿Cuánto pesa realmente un terabyte de pi?

La comparación con la industria del almacenamiento real aclara aún más la paradoja. Western Digital ya está trabajando en unidades mecánicas de 140 TB en los próximos años, mientras que Toshiba está experimentando con nuevas técnicas de grabación magnética para superar el límite actual de platos de 3,5 pulgadas. Ninguno de estos productores, por ambicioso que sea, persigue la idea de almacenar datos sin escribirlos: la capacidad real se mide en poco realmente registrado, no en coordenadas hacia una constante matemática. Ésta es precisamente la diferencia que separa a una industria de miles de millones de dólares de una broma académica que sobrevive en GitHub.

El futuro de los discos duros tradicionales también cuenta la misma historia desde otro ángulo: capacidad, compatibilidad y conveniencia siguen siendo los únicos tres ejes sobre los que se juega la competición, sin ningún atajo matemático en el horizonte. Los fabricantes aumentan la densidad de datos en los platos existentes en lugar de inventar formatos radicalmente nuevos, precisamente porque cada bit todavía tiene que encontrar un lugar físico en alguna parte. PiFSdesde este punto de vista, sigue siendo la excepción que confirma la regla: un sistema que sólo funciona mientras nadie le pide que archive algo verdaderamente útil.

Pero déjanos decirte: el encanto de la idea original permanece, el de un numero infinito que ya contiene cada texto, cada fotografía, cada programa jamás escrito o por escribir. A Borges le hubiera encantado. Pero también el oulipo (Obra literaria potencial“Taller de Literatura Potencial”), el grupo que marcó el punto de inflexión combinatorio y lúdico de la literatura francesa. Fundada en 1960 por Raymond Queneau y François Le Lionnaisel grupo reunió a escritores y matemáticos con el objetivo de crear textos siguiendo reglas y restricciones estrictas (escritura de restricción). No habían pensado en Pi como un contenedor de todos los textos posibles (e imágenes y cualquier otro contenido digital), pero les habría fascinado y probablemente les habría conquistado.

Hay que decir que éste es también un buen ejemplo de la intersección entre teoría y práctica. Desde el punto de vista puro de teoría matemáticaesta es una idea que no se niega. En cambio, teoría de la información cambia su tamaño inmediatamente: saber que existe un archivo dentro de Pi no significa que se pueda acceder a él sin costo alguno. Entre ambas afirmaciones existe la misma diferencia que separa una curiosidad de la que hablar en un artículo de verano y un sistema de almacenamiento de datos que funcione.