可判定的输出,不是“看完文章写一份总结”,而是让不同角色对同一份作业给出同一结论。做法是把题目写成“给定输入—执行动作—固定格式的产出—判定标准”四段式,其中产出必须能被第三人核对,判定标准必须能在不看答案的情况下执行。如果一份作业需要批改者“凭经验感觉对不对”,它就不是可判定输出。
常见情形是:一篇讲页面标题写法的文章,学员A交回“优化了标题,更符合搜索意图”,学员B交回“把原标题从15字改到22字,主词前置,补充了地域词”。两人都说自己按文章做了,但只有B的产出能被核对。分歧不在于谁更努力,而在于题目没有规定输出的形态。
这背后有两个合理解释。第一种解释:文章本身是解释性内容,讲的是判断原则,没有给出可执行的动作序列,学员只能各自翻译。第二种解释:题目只要求“应用知识”,没有要求固定产出格式,于是每个人都按自己熟悉的表达方式提交。两种解释会导向完全不同的修正方向——前者要补动作,后者要补格式。
能区分它们的证据,是拿同一份输入让多人独立做一遍。如果大家动作一致、只是表述不同,说明问题在输出格式,补模板即可;如果动作本身就分叉,比如有人改标题、有人改正文结构、有人去查外链,说明文章缺的是动作定义,需要先把知识拆成步骤再出题。
另一个可用的证据是“反查”:让学员说出自己每一步依据文章的哪一句。如果多数步骤找不到对应句子,属于第一种解释;如果每一步都能对上句子,但产出仍然五花八门,属于第二种解释。这一步本身就是实际动作,它的结果直接决定下一步是重写文章还是重写题目。
把知识转成实操题时,按以下四段写,缺一段就会留下判定空间:
假设一份作业要求为五个页面各写一个替换标题,判定标准设为三条:主词前置、长度在给定区间、与原标题差异可指出。批改时逐条打勾,三个人会得到接近的结论。如果标准写成“标题更吸引人”,同一份作业就会有人通过有人不通过。这里的数字只是说明比较方法,不是效果承诺。
当多个角色对同一事实理解不同,不要先争论谁对,先把分歧写成项目条目:
这三个动作的结果会改变下一步:如果分歧集中在动作定义,优先重写知识拆解;如果集中在格式,优先补产出模板;如果双方动作和格式都一致、只是结论不同,那说明判定标准还缺一条可勾选条件。
可判定的输出,判定标准必须能被第三人执行。把“写得好”“更合理”“符合意图”这类评价词替换成条件句:主语是谁、动作是什么、结果长什么样。例如把“标题符合搜索意图”改成“标题包含用户可能使用的疑问词形式,且该形式能在给定输入中找到对应依据”。
同时要允许“不适用”这一结果。有些页面在给定输入下无法产出合格标题,题目应允许标注“不适用并说明缺少哪项输入”。这比强行交一份凑数产出更有判定价值,因为它把“知识没覆盖到的情况”暴露出来,正好是下一轮出题要补的地方。
最后检查一遍:把作业交给没读过原文的人,他能否只靠判定标准判断通过与否。如果不能,问题不在学员,在题目。