Article

Deel 2 | Hammer Goldmine | Implementatie

3 min read28 mei 2024
Hammer Gold Mine

Vorige week legden we uit dat we een intern datawarehouse willen bouwen dat zonder menselijke tussenkomst up-to-date blijft. Zo'n datawarehouse zal ons enorm helpen bij het vinden van waardevolle informatie voor onze marktinzichten en bij het sneller vinden van die informatie. Maar voordat dit datawarehouse ons kan ondersteunen, moeten verschillende stappen in de verwerkingspijplijn worden geautomatiseerd zodat deze soepel verloopt.

Eerst moeten gegevens periodiek uit de relevante bronnen worden verzameld. Bepalen welke soorten gegevens in een database worden gebruikt, is essentieel voor het succes van de implementatie.

We hebben besloten ons (vooralsnog) te richten op ongestructureerde gegevens in de vorm van nieuwsartikelen. De hoeveelheid nieuws die vandaag de dag wordt gepubliceerd, is vrijwel onbeperkt.

Tijdens onze projecten willen we ons niet beperken tot een paar nieuwsbronnen, maar de beschikbare informatiewereld verkennen om verborgen parels te vinden die ons tijdens onze projecten diepere inzichten bieden. Traditioneel gezien is dit zeer tijdrovend. We verwachten dat het verwerken van dit type gegevens ons tijdens een kwalitatieve analyse de grootste tijdswinst oplevert.

Zodra de gegevens zijn verzameld, moeten ze goed worden opgeslagen zodat we ze snel kunnen opvragen wanneer we ze nodig hebben in een van onze projecten. Een belangrijke overweging bij het opslaan van de gegevens is hoe we deze standaardiseren. Standaardisatie is een tweesnijdend zwaard: een lage mate van standaardisatie maakt het moeilijk om verschillende gegevensinvoer via dezelfde pijplijn te verwerken, maar houdt de datakwaliteit hoog en de footprint klein.

Omdat we met ongestructureerde gegevens werken, bouwen we sowieso een zeer adaptief model. Dit betekent dat we een lage mate van standaardisatie kunnen toepassen en toch een gestroomlijnde pijplijn kunnen gebruiken.

Wanneer de gegevens goed zijn opgeslagen, kunnen we ons richten op hoe we de gegevens willen annoteren met informatie die ons kan helpen gegevensinvoer te identificeren die relevant is voor een specifiek project. Voorlopig hebben we besloten dit te doen door de gegevens in categorieën in te delen die gegevensinvoer bevatten die verband houdt met een specifiek domein van marktinformatie. Hierdoor kunnen we op elk moment tijdens het project alle gegevens opvragen die relevant zijn voor de meest urgente informatiebehoefte.

Deze labels worden toegevoegd met een active learning-aanpak. Tijdens de ontwikkelingsfase worden gegevens door een expert geannoteerd voordat ze door een machinelearningmodel worden verwerkt. Na elke iteratie worden de gegevens door de expert geëvalueerd voordat ze opnieuw door het model worden verwerkt. Met deze aanpak krijgt het model inzicht in de labels die we in ons datawarehouse willen gebruiken. Het doel van deze aanpak is de werklast van het model te maximaliseren en die van de expert te minimaliseren. Dit zorgt ervoor dat het proces van het toevoegen van een nieuw label aan de gegevens in korte tijd kan plaatsvinden. Uiteindelijk kan de expert volledig uit het proces worden gehaald en zal het model nieuwe gegevens zelfstandig labelen. Met deze aanpak hebben we met succes verschillende labels aan het datawarehouse toegevoegd en blijven we continu nieuwe labels toevoegen.

In de komende weken lichten we de afzonderlijke onderdelen van de Hammer Goldmine-pijplijn uit en hoe we verwachten dat deze onze workflow zullen verbeteren. In de volgende blog bespreken we deel 3 van Hammer Goldmine: de bruikbaarheid van de database en webinterface.