De datalekbronnen die we bewust niet gebruiken
Drie van de grootste beschikbare datasets hadden onze dekking op dag één verdubbeld. We lieten ze weg, en dit is de volledige redenering.
Dekking is in deze categorie het makkelijkste getal om te laten groeien, en het makkelijkste om oneerlijk te laten groeien. Verschillende veelverhandelde compilaties zijn verzamelingen van verzamelingen, zonder herkomst en met een flink deel verzonnen regels.
Voor een gebruiker doen twee soorten fouten ertoe. Een valse treffer stuurt iemand erop uit om inloggegevens te wijzigen die nooit zijn uitgelekt, en dat kost vertrouwen. Een verouderde treffer waarschuwt opnieuw voor een datalek uit 2013 dat al is afgehandeld, en dat kost aandacht.
Onze toets is saai: kunnen we de herkomst noemen, de gebeurtenis dateren en beschrijven welke velden erin zaten? Zo niet, dan gaat het er niet in, hoe groot het ook is.
Die prijs is echt — onze dekking bij de lancering is kleiner dan die van een concurrent die minder vragen stelt. We leggen liever een gat uit dan een verzonnen melding.