可判定的实操题,核心不是让答案“看起来对”,而是让批改者能在不追问作者意图的情况下,仅凭提交物判断是否完成。做法是先固定输入样本和允许动作,再要求输出包含可核对的判断依据、取舍理由和下一步动作。若题目只写“分析某页面排名问题”,输出会变成散文;若改成“在给定三个页面样本中,指出哪一个最可能因为标题与正文主题偏离而受限,写出你优先改哪一处、改后预期哪项可观察信号会变化”,就能判定。培训场景里,这种改造比增加题量更能暴露学员是否真会迁移知识。
观察记录回答“看到了什么”,决策记录回答“因此做什么”。只要求观察,学员容易堆砌术语;只要求决策,又容易跳过证据。可判定的题目应把两者串起来。
这样设置后,批改者不必猜学员“懂没懂”,只需核对位置、冲突类型和理由是否自洽。若学员只写“建议优化标题”,没有位置和冲突类型,就判为未完成,而不是判为错误。未完成和错误要分开,前者补观察,后者改判断。
规模化后出现例外,往往因为题目允许无限修改。把动作限定为三选一,能逼出取舍。
假设一个短例子:给学员五个页面样本,其中四个标题包含核心词,一个不包含。若题目问“哪个需要改”,多数人会选不包含的那个。若改成“在保留、改写、退出中选一个,并说明为什么另外两个不选”,学员就必须处理“不包含核心词但正文高度相关”的例外。这个例外正是规模化后常见的边界。
可判定不等于唯一答案。可以允许多个答案成立,但要求每个答案附带可核对条件。
批改时先看动作是否明确,再看验证是否与动作对应。若验证写成“看排名变化”,不可判定,因为排名变化受多种因素影响,不能单独证明该动作正确。应改成“看同一位置在下一批样本中是否仍被标为冲突”,这样才可核对。
个别样本成立但规模化后出现例外,常见原因是题目把某个样本的特征当成了通用规则。此时继续加题量,只会让例外更多。更有效的动作是回到题目,补一条边界条件。
例如原题要求“所有标题都必须包含核心词”。规模化后发现,品牌词页面、活动页和问答页并不适用。处理方式不是删掉规则,而是把题目改成:“在内容页样本中,标题与正文主题一致优先于核心词出现;若样本属于活动页,则退出该规则并说明理由。”这样保留、改写、退出三种动作都有明确适用前提。
这个动作的结果会直接影响下一步:若边界条件补上后,学员的退出理由集中在页面类型,说明规则本身可用,只需细化分类;若退出理由分散在行业、词性和样本来源,说明规则过于依赖个别样本,应缩小适用范围或换样本。不要用“请求量归零”或“抓取量下降”单独证明处理正确,这些现象也可能来自样本更换、统计口径变化或外部波动。可判定的输出始终是:位置、类型、动作、验证四件事能对上。