先给结论:排除内部流量后,如果访问量下降的幅度大于内部流量的历史占比,或者下降集中在少数落地页、少数地区、少数设备,就不能直接认定是“误删真实访问”;更可能是过滤规则写得太宽。此时应暂停扩大排除范围,回到原始日志或未过滤报表,按“同一访问者标识是否在过滤前后都出现”做一次交叉核对,再决定是收窄规则还是恢复数据。
常见做法有两种:一种是在站内统计工具里按IP段、登录账号或设备标识排除;另一种是在日志分析阶段用正则或字段条件剔除。两者的误删迹象不同,检查动作也不同。
选择哪种检查方式,取决于你手里还有没有过滤前的原始数据。如果原始日志保留完整,优先做逐条比对;如果只剩聚合报表,只能做总量与结构比对,结论强度会弱一些。
不要只看“排除后总量少了多少”。更有区分度的动作是:从过滤前的记录中抽取一批访问者标识,再到过滤后的数据里查这些标识是否还在。假设某站点过滤前某天有1000条访问记录,内部流量历史占比约8%;排除后剩下880条,少了12%。这个差额本身不能证明误删,因为内部流量占比可能当天升高。下一步应抽50个被过滤掉的标识,逐个检查其来源IP、落地页、设备类型和转化行为。
如果这50个里有超过一半的落地页是外部用户才会进入的页面,或者设备类型与内部常用设备明显不符,就说明过滤条件过宽。此时的动作是:把排除规则从“整段IP”收窄为“具体账号加固定设备”,然后重新跑一遍过滤,对比收窄前后被删记录的重合度。收窄后如果被删记录明显减少,但内部流量识别仍然覆盖主要内部访问,说明之前的规则确实误伤了外部访问。
这个动作的结果会直接影响下一步:如果收窄后外部访问恢复,就不需要恢复全部原始数据,只需修正规则;如果收窄后内部流量又混进来,说明内部访问本身没有稳定标识,应该改用“标记而非删除”的方式,把疑似内部流量单独分组观察,而不是直接从总量中剔除。
总量下降可以由很多原因造成:真实访问减少、统计口径变化、过滤条件变严、数据延迟。要判断是否误删,应看过滤前后结构是否发生异常偏移。
这里要说明一个常见误区:第三方估算流量、搜索引擎报告和站内统计的口径本来就不同。站内统计排除内部流量后数值下降,不能直接和第三方估算做差值得出“误删了多少”。第三方估算通常基于抽样和模型,不能还原具体访问者。可核查的证据链应来自你自己的日志、统计工具原始事件和过滤规则记录,而不是拿两个不同口径的总量相减。
有些内部访问并不来自固定IP,也不登录账号,比如远程办公、移动网络、共享设备。这种情况下,强行排除很容易误删真实访问。更稳妥的选择是:不删除,只标记。
具体动作是:在统计或日志中增加一个“疑似内部”分组,把符合部分条件的记录放进去,但保留在总量中。然后观察这个分组的大小和结构。如果它长期只占很小比例,且落地页与外部访问明显不同,再考虑单独分析;如果它和外部访问混在一起,说明当前没有足够依据做排除。
这个选择的条件是:你能否承受总量中混有少量内部流量。如果能,标记比删除更安全;如果不能,就必须先建立可靠的内部访问识别依据,比如统一出口、统一账号或统一设备标记,否则任何排除都是在猜。
最后检查一步:无论用哪种方式,改动过滤规则后都要保留改动前后的两份数据至少一个对照周期。这样当访问量再次异常时,你能判断是规则改动导致的,还是外部流量本身发生了变化。没有对照数据,后续任何“是否误删”的判断都缺少依据。