Questo post é stato letto 110 volte!

ArchiveBox si afferma come uno strumento innovativo, andando ben oltre il concetto tradizionale di una semplice “wayback machine privata intelligenza artificiale”.

Questa piattaforma personale è progettata per registrare porzioni significative del web nel tempo, inclusi pagine, cronologia di navigazione e sessioni autenticate.

Grazie a funzionalità avanzate come i crawl ricorrenti e l’integrazione con GUI, plugin, MCP e strumenti di automazione, ArchiveBox si rivela uno strumento indispensabile per chiunque desideri preservare informazioni digitali.

Archivebox: non solo codice HTML

Un approccio multi-formato per la conservazione web

Il principio cardine di ArchiveBox risiede nella sua capacità di conservare una singola URL attraverso multiple rappresentazioni indipendenti.

Questo significa che una pagina web può essere archiviata in diversi formati, garantendo una maggiore resilienza e completezza dell’informazione. 1.

HTML: il codice sorgente della pagina. 2.

PDF: una rappresentazione visiva fedele. 3.

Screenshot: immagini della pagina così come appare. 4.

Testo dell’articolo: estrazione del contenuto testuale principale. 5.

MHTML: un archivio web completo. 6.

Risorse multimediali: video, audio e immagini incorporate. 7.

Repository Git: per il controllo versione dei contenuti. 8.

Metadati: informazioni aggiuntive sulla pagina.

Questa architettura a plugin rende estremamente semplice combinare gli strumenti esistenti e aggiungerne di nuovi.

L’utilizzo di acquisizioni multiple riduce la dipendenza da un singolo formato, superando le limitazioni di ciascuno (ad esempio, un PDF non conserva il comportamento interattivo, mentre uno screenshot non include i collegamenti).

ArchiveBox salva anche dati solitamente trascurati, come reindirizzamenti, intestazioni HTTP, DNS, certificati TLS, log della console e l’accessibility tree, offrendo una collezione completa di artefatti che descrivono l’esperienza del browser durante l’acquisizione.

La cronologia del browser diventa un archivio

Estensione browser e gestione delle sessioni

Le nuove funzionalità dell’estensione per browser di ArchiveBox rappresentano un passo avanti significativo. È ora possibile importare bookmark e cronologia da Chrome, Brave, Edge, Firefox e Safari.

L’estensione può anche acquisire localmente screenshot e MHTML prima di inviare i dati al server ArchiveBox self-hosted.

Questo apre scenari interessanti per diverse categorie di utenti: 1.

Ricercatori: possono conservare automaticamente URL specifiche visitate durante le indagini. 2.

Sviluppatori: archiviano documentazione tecnica e repository consultati. 3.

Aziende: mantengono copie periodiche di pagine pubbliche o documenti web rilevanti.

Le “allowlist” e “denylist” permettono di filtrare quali URL meritano di essere conservate, evitando l’archiviazione indiscriminata.

Archiviare contenuti dietro un login

Le personas per l’autenticazione

Una vasta quantità di informazioni sul web è accessibile solo dopo l’autenticazione.

ArchiveBox introduce le “Personas” per affrontare questa sfida.

Una Persona associa un profilo browser, cookie, impostazioni e stato di autenticazione a un’identità specifica, utilizzabile durante il crawling (scansione e recupero dei contenuti).

ArchiveBox può importare profili da Chrome, Chromium, Brave ed Edge, riutilizzando le sessioni esistenti per acquisire pagine protette. È fondamentale notare che questa funzione non aggira l’autenticazione, ma sfrutta sessioni a cui l’utente ha già accesso.

La sincronizzazione dei cookie comporta implicazioni di sicurezza, poiché le credenziali di sessione vengono affidate al server ArchiveBox.

Una Persona può contenere cookie, local storage, IndexedDB, service worker e altre informazioni associate al profilo Chromium, con ArchiveBox che crea una copia per il sistema di acquisizione senza modificare il profilo originale.

Monitoraggio automatico e integrazione AI

Scheduler e agenti intelligenti

ArchiveBox permette di programmare importazioni periodiche di URL, feed RSS, bookmark e altre sorgenti, eliminando la necessità di configurare sistemi di pianificazione esterni.

Lo scheduler integrato nel database di ArchiveBox controlla le pianificazioni e avvia nuovi crawl al momento opportuno, creando una sequenza di snapshot consultabili nel tempo.

Questo è particolarmente utile per monitorare l’evoluzione di pagine con prezzi, documentazione o condizioni di servizio.

L’ultima versione introduce anche un server MCP (Model Context Protocol), che espone le operazioni di ArchiveBox come strumenti per i client MCP.

Un agente compatibile può aggiungere URL, interrogare l’archivio e lavorare sui record.

L’integrazione opzionale con OpenCode e un file SKILL.md per gli agenti di sviluppo aprono scenari interessanti: un agente AI potrebbe cercare nell’archivio pagine relative a un prodotto, riacquisire quelle non aggiornate o verificare snapshot privi di screenshot o PDF.

L’interfaccia non è più solo grafica o a riga di comando, ma anche un software esterno può interagire con ArchiveBox per automatizzare operazioni complesse.

Guida rapida all’installazione e all’uso

Avviare archivebox con docker compose

Per esplorare ArchiveBox, il metodo più semplice è installarlo e affidargli una pagina da conservare.

Gli sviluppatori raccomandano Docker Compose per un ambiente completo. 1.

Creare una directory: mkdir -p ~/archivebox/data && cd ~/archivebox 2.

Scaricare la configurazione: curl -fsSL ‘https://docker-compose.archivebox.io’ > docker-compose.yml 3.

Avviare i servizi: docker compose pull && docker compose up -d –wait

La directory ‘data’ conserva la collezione.

L’interfaccia amministrativa è accessibile su admin.archivebox.localhost:5797.

Salvare la prima pagina web e automatizzare

Per aggiungere una URL, dalla directory con ‘docker-compose.yml’, eseguire: docker compose run –rm archivebox add ‘https://example.com’ Oppure, se il container è attivo: docker compose exec archivebox archivebox add ‘https://example.com’

ArchiveBox esamina l’URL e avvia i moduli extractor configurati, producendo rappresentazioni multiple.

Accetta anche elenchi di indirizzi da file di testo o feed RSS.

Per il monitoraggio quotidiano: docker compose run –rm archivebox \ schedule –every=daily ‘https://example.com’ Per visualizzare le pianificazioni: docker compose run –rm archivebox schedule –show

ArchiveBox può essere gestito anche tramite un’interfaccia web interattiva, accessibile da admin.archivebox.localhost:5797/admin/.

La GUI permette di aggiungere URL, consultare snapshot e gestire l’archivio.

L’estensione per browser si integra con questa modalità, inviando direttamente le pagine al server, senza la necessità di usare la riga di comando.

La CLI è uno strumento potente per l’automazione, ma l’interfaccia grafica offre un’esperienza più visuale per l’uso quotidiano.

Questo post é stato letto 110 volte!