Cyberinity12 Aug 2026索引设计数据来源伦理7 分钟
我们决定不使用的泄露数据来源
现有最大的三个数据集,本可以让我们上线第一天的覆盖面翻倍。我们没有采用它们,以下是完整的理由。
在这个领域,覆盖面是最容易增长的数字,也最容易以不诚实的方式增长。好几个被广泛交易的数据合集是层层汇总而来的,没有来源记录,其中还有相当比例的伪造数据。
对用户来说,有两种失败方式最要紧。误报会让人去更换从未暴露过的凭据,这会消耗信任。过时的命中会就一个他们早已处理过的 2013 年泄露事件再次发出提醒,这会消耗注意力。
我们的检验标准很朴素:能否说出来源、确定事件日期,并描述其中包含哪些字段?如果不能,无论数据量多大,都不会上线。
代价是真实的——我们上线时的覆盖面,比那些不问这么多问题的竞争对手要小。我们宁愿解释一处空白,也不愿解释一条凭空捏造的提醒。