结论有条件:只有当自动评分展示的是可复核的证据链,而不是一个不可解释的分数时,人工判断项目才不会被评分替代。若评分把“页面可疑”直接折算成“已挂马”,人工复核就会退化成给分数盖章。此时最小动作是要求工具输出命中位置、匹配规则和原始片段,再决定是否升级处置;但这只能证明评分依据存在,不能证明站点已被入侵或未被入侵。
人工判断通常分三段:发现异常、判断性质、决定处置。自动评分适合压缩第一段,把大量页面、脚本和外链按可疑程度排序;一旦它开始代替第二段,问题就出现了。例如评分把一段被注入的混淆代码判为“高危”,但这段代码可能来自站长自己引入的第三方统计或客服脚本。工具没有权限读取变更记录时,无法区分“新出现的可疑代码”和“一直存在的业务代码”。
可执行的最小动作:让工具对每个命中项输出三项信息——命中文件的路径与行号、触发规则或特征、原始代码片段。拿到这三项后,人工只需判断该片段是否属于已知业务代码。若属于,评分应被降级为“待确认”;若不属于,再进入处置流程。这个动作的结果会直接影响下一步:证据可复核时,评分可以作为排序工具;证据缺失时,评分只能当作线索,不能作为封禁、删除或对外通报的依据。
假设某站点被注入了条件触发的跳转代码,只有来自特定来源的访问才会触发。挂马扫描软件在常规抓取下没有命中,评分显示低风险。站长据此认为站点安全,但真正的原因可能是扫描请求没有满足触发条件,或者访问日志已被清理,导致异常请求记录缺失。这里评分变低并不等于风险消失,它只说明当前可见数据里没有匹配项。
这个反例成立的适用条件是:站点缺少完整访问日志、没有文件完整性基线,或扫描范围不包含动态输出。反过来说,如果工具能提供文件哈希对比、最近修改时间和请求样本,低评分才有更强的参考价值。需要核对具体工具是否具备这些能力,不能假定某个品牌一定提供。
没有服务器权限、拿不到完整日志时,仍然可以执行一个最小动作:对评分最高的若干命中项做人工抽样,逐条记录“路径、片段、是否可解释、解释人”。可解释指能对应到已知插件、主题模板、CDN 脚本或运维变更;不可解释指找不到来源,且片段包含编码、拼接或远程加载行为。抽样结果不是最终结论,但它能回答一个关键问题:评分是否至少指向了真实存在的代码差异。
防止被自动评分替代,不是拒绝评分,而是让评分进入一条有复核痕迹的流程。记录至少包含:评分时间、命中数量、抽样数量、每条抽样的判断结论、判断依据、未解决项。这样做的结果会影响后续动作:有依据的结论可以进入修复或忽略;没有依据的结论只能继续观察。交接时,下一位处理人不必重新猜测评分含义,而是直接看到哪些项目已经人工确认、哪些仍然悬空。
需要提醒的是,评分下降、命中归零或某项统计消失,都不能单独证明处理正确。它们还可能来自扫描范围缩小、规则更新、访问路径变化或数据未被采集。要证明风险已解除,需要回到具体文件、具体请求和具体变更记录上核对。
下一步动作可以固定为:先要求工具提供可复核证据,再对最高评分项做人工抽样,最后把可解释与不可解释的项目分开记录。由此能推出的是“哪些评分有依据、哪些没有”;不能推出的是“站点绝对安全”或“某个工具一定可靠”。如果工具只能给出一个总分,而无法提供命中位置和原始片段,那么人工判断就没有落点,此时应优先补足证据输出,而不是继续比较分数高低。