Kostenbeheersing & efficiëntie

Beter Inzicht in Bodemrisico’s dankzij Automatische PDF-Data-Extractie bij Stantec

Geef ons een uitdaging en we gaan direct aan de slag! Voor ingenieursbureau Stantec hebben we de PDF-data-extractie van de Soil Risk Map (SRM) grondig geoptimaliseerd. De verwerkingssnelheid steeg met een factor 60, terwijl een vernieuwd implementatiemodel zorgt voor een krachtige, schaalbare cloudoplossing

Beter Inzicht in Bodemrisico’s dankzij Automatische PDF-Data-Extractie bij Stantec
Klant Stantec
Expertise Data & AI
Boutique BigData Republic

De uitdaging

  • Enorm datavolume: Stantec beheert de Soil Risk Map (SRM), die gebruikmaakt van een archief van 250.000 PDF-documenten met bodemanalyse-certificaten, dat elke maand groeit met 10.000 tot 20.000 bestanden. Handmatige verwerking was onmogelijk (sommige documenten bevatten duizenden pagina's).

  • Trage en beperkte PoC: De bestaande Proof of Concept (PoC) verwerkte slechts 12% van de documenten succesvol en was extreem traag (meerdere minuten per document door trage Python-bibliotheken zoals PdfPlumber en Camelot-python).

  • Strikte kwaliteits- en cloud-eisen: Fouten in bodemdata (zoals asbestmetingen) brengen grote operationele risico's met zich mee. Bovendien was er beperkte Azure-cloudtoegang en beperkte trainingsdata (slechts ~1% van het totale corpus beschikbaar tijdens ontwikkeling).

De oplossing

  • Snellere PDF-ingestie via XPDF (XPyDF): De trage Python-extractietools werden vervangen door XPDF (C++). BigData Republic ontwikkelde hiervoor de open-source Python wrapper XPyDF, waarmee tekst met behoud van karakterposities extreem snel wordt geëxtraheerd.

  • Strikt foutafhandelingskader: Implementatie van een custom error-handling framework dat bij onverwachte pagina-indelingen gecontroleerd stopt, zodat alleen 100% betrouwbare data wordt verwerkt.

  • Prestatieanalyse met Sankey-diagrammen: Inzet van Plotly Sankey-diagrammen om de prestatie van de extractiecomponenten datagedreven te monitoren en te optimaliseren.

  • Schaalbare Azure-cloudarchitectuur: Uitrol in Microsoft Azure met behulp van een Function App, Container Instance en 3 opslagcontainers (Input, Data-batch, Results).

Het resultaat

  • 60x snellere extractie
  • Verdubbeling van het succespercentage
  • Betrouwbare Cloud MVP
  • Kosten- en tijdsbesparing