先给结论:排除内部流量后,如果外部访问量下降的幅度与内部流量占比大致相当,通常说明过滤生效而没有误删;如果下降幅度明显超出内部流量占比,或者被过滤的访问里出现本应保留的行为特征,就要怀疑真实访问被一并删掉了。检查的重点不是看总量变没变,而是看被删掉的那部分记录长什么样。
排除动作本身要能重复。记录你用的判定条件:是IP段、账号登录状态、设备标识,还是这几项的组合。假设某天站内统计显示访问量为1000,其中按IP段标记为内部的记录有120条,过滤后剩880条。这个880就是后续对比的基准。如果换一个人、换一个时间重新执行同样的过滤,得到的数字应该接近880;如果差别很大,说明判定条件不稳定,此时讨论有没有误删没有意义,因为过滤结果本身不可复现。
还要注意不同来源的口径差异。第三方估算、百度搜索资源平台给出的展现与点击、站内日志或统计工具记录的访问,本来就是三套不同的东西。站内统计里的“访问”可能包含直接输入网址、收藏夹进入、站内跳转等,而搜索报告只覆盖来自搜索结果的点击。用其中一套的数字去校验另一套的过滤结果,容易得出错误结论。
把排除前的访问按来源、落地页、时间段、新老访客分成几段,排除后再看同样的分段,哪一段掉得最多。真实访问被误删时,通常不会均匀地掉,而是集中在某一类特征上。比如按IP段过滤,如果公司出口IP和某个地区运营商的IP段重叠,那么来自该地区的真实访客会被一起删掉,表现为该地区访问量异常归零,而其他地区基本不变。
如果只有总量下降、各分段等比下降,更可能是过滤条件本身覆盖过宽;如果只有某一段归零,优先怀疑该段的判定规则误伤了真实用户。
被过滤掉的记录不要直接丢弃,先留一份样本。真实访问和内部访问在行为上往往有可区分的痕迹,但这不是绝对的,只能作为辅助证据:
这些特征单独看都不够,需要组合起来。比如一批被删记录既有搜索来源、又有正常翻页、还落在非工作时段,那误删的可能性就明显上升。
确认存在误删后,有三种处理方向,适用条件不同。
保留并改写规则:当误删比例小、且能定位到具体误判条件时适用。比如发现某个IP段里混有真实用户,就把整段过滤改成“IP段+登录状态”双重判定,只删同时满足两项的记录。动作是调整判定条件后重新跑一遍历史数据,看外部访问量是否回到接近过滤前的水平,同时内部访问是否仍被有效剔除。结果会影响下一步:如果两者都能兼顾,就固定这套规则并记录版本;如果内部访问又漏进来了,说明条件收得过松。
保留原规则、单独标记疑似记录:当无法确定某批记录到底是不是真实访问时适用。不直接删除,而是打上标记,在后续分析中单独观察。这样做的好处是不丢数据,代价是统计口径变复杂,需要在使用时明确说明哪些记录被标记过。
退出当前过滤方案:当误删范围大、判定条件依赖的标识本身不稳定(如设备标识频繁变化)时适用。此时继续微调可能只是把误删从一个地方挪到另一个地方,不如回到只按账号登录状态这类确定性更高的条件过滤,接受一部分内部访问留在数据里,再在分析时人工剔除。
需要提醒的是,访问量归零或某项统计突然下降,不能单独证明过滤正确或错误。缓存、统计脚本加载失败、日志采集中断、百度搜索结果展现波动,都可能造成类似现象。判断误删要有行为特征和分段对比作为证据链,而不是只看一个总数。做完这一步,你才能确定该保留现有规则、改写判定条件,还是暂时退出过滤、改用人工复核。