스레드
C

EL WEB SCRAPING HA MUERTO
Han creado PixelRAG.
Un sistema open source que pasa de parsear HTML.
En vez de convertir una web en texto...
hace una captura de pantalla.
Y luego un modelo vision-language lee la respuesta directamente desde los píxeles.
Brutal.
Porque el scraping tradicional rompe muchísima información:
→ tablas
→ gráficos
→ layouts
→ columnas
→ botones
→ PDFs
→ páginas mal estructuradas
Todo eso se pierde cuando conviertes una web en texto plano.
PixelRAG hace algo mucho más simple:
indexa la página tal y como la ve una persona.
El equipo ha creado un índice visual de Wikipedia entero:
+30 millones de screenshots.
Y aun así supera al mejor RAG basado en texto por un 18,1% en QA.
Tiene también un plugin para Claude Code.
Básicamente le da ojos a Claude.
Le pasas una URL, un paper de arXiv o tu web local…
y Claude no scrapea el DOM.
La mira.
Cómo funciona:
→ renderiza webs, PDFs e imágenes en tiles
→ los embebe con Qwen3-VL-Embedding
→ construye un índice FAISS
→ busca visualmente sobre píxeles
Todo open source bajo Apache-2.0.
Link al repo en los comentarios
PM 8:02 · 2026년 7월 28일

Repo:
GitHub - StarTrail-org/PixelRAG: The end of web parsing. The beginning of scalable pixel-native...

[댓글 @fjpedrosa86]
Así solo verás lo que aparece en la imagen, pero perderás mucha información

출처 · X/@josesilesdata

EL WEB SCRAPING HA MUERTO Han creado PixelRAG. Un sistema…
0 좋아요 0 답글 8 조회