Perplexity presentó Photon, un motor de recuperación y clasificación creado para su buscador de IA, y afirma que redujo de unos 800 a 65 milisegundos la latencia p99 de esa etapa. La tecnología también sustenta un nuevo preset rápido de su Search API, que, según la empresa, recorta 68% el costo estimado por tarea en seis benchmarks agénticos frente a la configuración predeterminada.
***
- Perplexity asegura que Photon redujo a 65 ms la latencia p99 de recuperación y clasificación, desde unos 800 ms en el sistema anterior.
- El preset rápido basado en Photon registró 160 ms de latencia p50 y 230 ms p95 en una llamada de búsqueda, según la empresa.
- En seis benchmarks agénticos, Perplexity reportó un costo estimado 68% menor que el preset por defecto y una calidad agregada comparable.
⚡ Perplexity afirma que Photon bajó de 800 a 65 ms la latencia p99 de su buscador.
Su preset rápido redujo 68% el costo estimado en seis benchmarks.
La empresa reportó menor calidad en algunas métricas frente al preset predeterminado. pic.twitter.com/4EQuXIs8nU
— Diario฿itcoin (@DiarioBitcoin) September 30, 2026
Perplexity presenta Photon, su motor propio para acelerar la búsqueda de IA
Perplexity desarrolló Photon, un motor interno de recuperación y clasificación que ahora impulsa su infraestructura de búsqueda y sirve de base para un preset rápido de su Search API. La empresa afirma que, tras reemplazar el sistema anterior, la latencia p99 de esa etapa cayó de unos 800 milisegundos a cerca de 65 milisegundos. La mejora apunta a reducir demoras en la selección y el ordenamiento de páginas que luego alimentan las respuestas generadas por sus modelos.
El anuncio combina un cambio de infraestructura con una oferta dirigida a desarrolladores que priorizan la velocidad. Según la compañía, el preset rápido registró 160 milisegundos de latencia p50 y 230 milisegundos p95 en una sola llamada de búsqueda, y redujo 68% el costo estimado de modelo más búsqueda por tarea en seis benchmarks agénticos, con una puntuación agregada comparable a la del preset predeterminado.
Un motor construido para las cargas de búsqueda de Perplexity
Los sistemas de recuperación y clasificación rastrean un índice para encontrar páginas relacionadas con una consulta y ordenarlas antes de que otro componente obtenga su contenido. En un buscador de IA, esa selección aporta material al modelo que formula la respuesta, por lo que el tiempo que consume puede afectar la velocidad de la experiencia completa. Photon se ocupa de esa etapa, pero no representa por sí solo toda la latencia del producto: las cifras de producción citadas por Perplexity cubren las fases internas del motor y excluyen pasos posteriores de la pila de búsqueda.
Perplexity explica que al principio adaptó un motor de código abierto, pero que el crecimiento del índice y de las cargas de trabajo llevó a límites difíciles de resolver en costos, latencia de cola y recuperación de nodos. En el sistema anterior, el p99 rondaba los 800 milisegundos y podía subir a unos 1,2 segundos durante fusiones del índice en disco, por periodos de 10 a 15 minutos. La empresa atribuye esos picos, en parte, a lecturas de datos que no cabían en la memoria disponible.
La compañía también describe como lenta la incorporación de clústeres y la sincronización de datos: algunas operaciones podían tardar más de una semana. Durante recuperaciones tras fallos, una proporción mayor de respuestas de búsqueda quedaba incompleta, lo que, según Perplexity, podía perjudicar la calidad de las respuestas finales. Frente a esas limitaciones, la empresa decidió construir Photon desde cero en lugar de seguir ampliando su bifurcación del sistema anterior.
La arquitectura distribuye el trabajo entre un broker y grupos de shards, que son particiones del índice. El broker envía consultas a los shards seleccionados, reúne sus candidatos y los ordena antes de devolver los resultados al servicio de búsqueda de nivel superior. Por otra ruta, los indexadores preparan las actualizaciones, mientras un controlador coordina la construcción y el despliegue de nuevas versiones, de forma que ese proceso no compita directamente con las consultas en vivo.
Datos compactos y lecturas diseñadas para reducir demoras
Photon organiza la información de dos maneras complementarias para responder a las distintas etapas de una búsqueda. Un índice invertido asocia cada término con una lista de documentos que lo contienen, lo que permite localizar candidatos; registros separados por documento aportan detalles para clasificarlos. Perplexity sostiene que los formatos compactos reducen la cantidad de datos que el motor necesita leer o mover y ayudan a controlar cuánto trabajo realiza para cada consulta.
Las listas de documentos no se guardan todas con una representación idéntica. Las listas cortas caben dentro de una página, mientras que las más extensas se dividen en bloques: los dispersos usan arrays ordenados y los densos, mapas de bits. La empresa dice que también agrupa en disco las listas consultadas con frecuencia y ordena los documentos de cada lista mediante una señal de utilidad, con el objetivo de encontrar antes candidatos prometedores.
Para seleccionar candidatos sin recorrer exhaustivamente cada lista, Photon usa un algoritmo de tipo WAND. Algunas listas impulsan la búsqueda de documentos candidatos y otras aportan información para calcular sus puntuaciones; además, el sistema puede descartar opciones que no alcancen el umbral de admisión sin leer todos sus datos exactos. El proceso comienza con un requisito estricto de cobertura y puede relajarlo si encuentra pocos resultados, una estrategia que limita el trabajo sin garantizar que el conjunto retenido sea siempre un top-k exacto.
Una vez elegidas las páginas, el motor necesita características como la frecuencia de términos, los campos en que aparecen y la posición de cada coincidencia. Photon las agrupa en registros compactos por documento, llamados docblobs, para evitar accesos dispersos a numerosos pares de término y documento. El formato permite buscar términos en una lista codificada y decodificar solo las posiciones correspondientes a coincidencias relevantes, en vez de expandir por completo cada registro.
El sistema también combina una caché preparada para solicitudes por lotes con lecturas asíncronas de disco. Según la descripción técnica de Perplexity, Photon revisa primero si los registros solicitados están en memoria y envía a disco únicamente los faltantes; cuando necesita varias lecturas, puede iniciarlas en paralelo mediante io_uring para solapar parte de la espera. La caché evita ciertas asignaciones y bloqueos durante las consultas y utiliza un mecanismo de expulsión CLOCK.
Despliegue y resultados reportados por la empresa
Perplexity separó la construcción del índice del servicio de búsqueda: los indexadores generan estructuras listas para operar en máquinas distintas de las que atienden consultas. La empresa afirma que la preparación distribuida permite construir el índice web completo en un número de horas de un solo dígito, frente a los procesos de recuperación que antes podían prolongarse durante días. Así, los recursos para construir índices y responder búsquedas pueden ajustarse de manera independiente.
El despliegue también cambia la manera de actualizar el sistema en producción. El controlador comprueba que el índice nuevo esté completo y rota los grupos de servicio uno por uno: retira un grupo del enrutamiento, carga la versión siguiente y reproduce consultas de registros anteriores para calentar sus cachés antes de devolverlo al tráfico. Mientras tanto, los demás grupos continúan atendiendo solicitudes, y el estado persistido permite reanudar una operación interrumpida.
En las mediciones de producción que reporta, Perplexity sitúa el p99 de Photon en unos 65 milisegundos, frente a cerca de 800 milisegundos del motor anterior, y dice que ya no observa los picos asociados con los cambios de versión del índice. También afirma que Photon usa aproximadamente 20% menos máquinas de servicio equivalentes que los antiguos nodos de contenido y almacena cerca de 2,5 veces más datos por documento. La empresa estima que mantener en memoria el mismo conjunto de datos de Photon con mlock requeriría 4,6 veces más memoria residente que la que utiliza actualmente.
La compañía presenta el nuevo preset rápido de su Search API como una opción para flujos de trabajo sensibles a la latencia. En seis benchmarks agénticos, WideSearch, BrowseComp, DSQA, FRAMES, SEAL-0 y SEAL-Hard, asegura que obtuvo la mayor puntuación agregada de tareas y el menor costo total estimado entre las configuraciones probadas. La comparación publicada abarca 3.554 tareas: PPLX Fast marcó 64,3% con un costo estimado de USD $59,73, frente a 64,0% y USD $187,60 del preset predeterminado.
Esas cifras requieren cautela: Perplexity advierte que las mediciones de latencia de proveedores distintos no son una comparación controlada equivalente, porque pueden usar percentiles y configuraciones diferentes. Además, la empresa reconoce una compensación en evaluaciones internas de calidad de búsqueda: el preset rápido obtuvo una puntuación DCG de 2,21 frente a 2,45 del predeterminado, y la disponibilidad de respuestas bajó de 0,596 a 0,567. Por eso recomienda la opción rápida para tareas agénticas cotidianas y la configuración predeterminada para consultas más difíciles o ambiguas, donde prioriza una calidad más robusta.
La iniciativa forma parte del traslado progresivo de la infraestructura de búsqueda de Perplexity a herramientas internas basadas en Rust. Photon reemplaza el motor anterior y, de acuerdo con la compañía, permite aprovechar formatos de datos y procedimientos de despliegue ajustados a sus propias cargas de trabajo. La empresa afirma que seguirá trabajando para admitir índices más grandes y datos documentales más ricos en el mismo hardware, aunque los resultados y las comparaciones difundidos hasta ahora corresponden a sus propias mediciones.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
China
Trump rechaza una alianza de IA con China y prepara nombramiento de un “zar de la Superinteligencia”
Empresas
H Company lanza Holo4 y separa los derechos de autoalojamiento de sus modelos
Bitcoin
Hut 8 obtiene una línea de crédito de USD $1.070 millones, con una exigencia de liquidez del 40%
Bancos y Pagos
