2026年8月26日
監査のように採点する
このページは機械翻訳されたもので、確認待ちです。
採点は、ほぼ正しいことが最も高くつき、最も見抜きにくい場面です。一字一句ではないが近い引用。誤った表に基づく数値。反例がひとつ多いだけの褒め言葉。これらはどれも一見しただけでは誤りに見えませんが、すべてが学生の手元に届きます。そして「もっと注意深くなる」ことは戦略にはなりません——構造的に見えないように作られた失敗モードに、注意力だけで対抗することはできないのです。
このプロジェクトは、注意深くなろうとする努力をやめ、代わりに構造を作った結果生まれたものです。読める手法、コピーできるテンプレート一式、そしてワークフロー全体を実行するインストール可能なClaude Codeプラグインという形を取っています。
成績に対して行うこと、正確に言えば
このツールは成績に一切触れない、と言えれば話は簡単です。しかしそれは事実ではなく、ソースを読めば誰でもすぐに気づくでしょう。真実の方がずっと役に立ちます。
これは、目的がフィードバックにある採点ツールです。 評価を起草し、成績案を提示しますが、それは単に到達した数値ではありません。提示される成績は算術の結果です。つまり、各減点が具体的な問題点を挙げ、教員が開いて確認できる根拠を示した上で残った点数です。全体的な印象だけを理由に減点されることはありません。全体的な印象には引用できる根拠がないからです。すべての指摘は提案にすぎず、承認されて初めて適用され、あらゆる結果を決定するのは教員です。
その結果として残る記録は、説明責任が求めるものそのものです。教員向けのガイダンスは一貫して、成績への責任は教員にあり、その根拠を説明できなければならないとしています。この手法を実行すれば、その説明は余分な作業としてではなく、副産物として自然に残ります。
ループと、重要な数字
各ラウンドでは、提出物ごとに一人の匿名監査者を割り当てます——その学生の課題だけを保持する、まっさらなコンテキストを持つ独立したエージェントであり、見るべきでないものによって汚染されることがありません。続いて、一人のリード担当者が全提出物を横断的に読みます。公平性はコホート全体に関わる性質であり、匿名の読み手にはコホート全体を見渡すことができないためです。指摘事項と、ハーネスが答えられない疑問点は、すでに下された決定としてではなく、下すべき裁定として、まとめて人間に渡されます。すべての教訓はルールブックに書き戻され、それが完了するまでラウンドは終了しません。
見出しとなる結果は、多くのツールなら伏せてしまうようなものです。14回の監査ラウンド、70件の独立したレビューを通じて、指摘によって成績が変わったことは一度もありません。 見つかった問題はすべて、根拠や表現を改善するものでした——誤った引用、誤った数値、根拠のない褒め言葉。これは失望すべき結果ではなく、設計そのものです。ループが守っているのは学生が読むものであり、その結果を守っているのはラウンド数ではなく、教員の判断と根拠に関する規律なのです。
失敗を、成功と同じだけ語る
うまくいった点だけを述べる説明は、その手法に頼るべきかどうかを判断しようとする人にとってはあまり役に立ちません。そこで、この手法がどこで失敗したかを述べます。
あるランでは9ラウンドを経ても収束しませんでした。最終的に止めた決め手は、審査をきれいに通過したことではなく、実際に出荷される内容の差分でした。ループが見つけ出す欠陥の大半が、自分自身の修正の中にあるものになっていたためです——つまり、課題そのものの誤り率ではなく、自分自身の編集率を測るようになっていたのです。これを検知するための明示的なルールが現在存在しますが、それはこの一件があったからこそです。
さらに悪いことに、そしてより示唆的なことに、その9ラウンド・45件の独立したレビューすべてを経た後、完成した資料を予備知識なしで読んだ一人の人間が、それらすべてが見逃していた欠陥を見つけました。それは世界についての主張(「これはきっとあなたの役に立つでしょう」)であり、未来についての主張はどんな根拠であっても反証することができません。これはこの問題の構造的な側面であり、レビュアーを増やしても解消しません。ハーネスは捕捉するよう作られた失敗モードには収束しますが、うまく機能すればするほど、それ以外に対しては盲目になっていきます。解決策はエージェントを増やすことではありません。人間です。
プライバシーについて、そして約束できないことについて
提出物は採点前に仮名化できます——コンテナにランごとのランダムなコードを付与し、ハッシュ検証を伴うバイト単位の複製を作成し、氏名との対応表はワークスペースの外に保管します。これを行う第一の理由は匿名採点であり、これは弁護士を必要としない教育学的な論拠です。
限界についても、機能と同じくらい率直に述べます。仮名化は匿名化ではありません——実在の人物に成績を返却しなければならないため鍵を保持することになり、GDPR前文26項の下ではそれによってデータは個人データのままとなります。コンテナを仮名化しても内容までは仮名化されないため、内部に「By Jane Doe」と書かれた提出物は、仮名化後もそのままです。そして、ある限界については特に名指しする価値があります。小規模なゼミで最も問題になりやすいものだからです。この手法は、ある学生へのフィードバックの中で別の学生を名指ししたり特徴づけたりすることを禁じ、チェック可能な限り機械的にそれを検査します。しかし、比較を含む発言は誰かを名指ししなくても情報を漏らしうるのです。*「Xを使っていたのはあなたの提出物だけでした」*という一文は、他の全員の課題について何かを読み手に伝えてしまいますが、これに機械が照合できるトークンは存在しません。私たちはこうした事態を避けようとしていますが、それを保証することはできません。このリスクはクラスの規模が小さくなるほど大きくなり、あなたの地域のプライバシー法および所属機関の方針に対する責任は、このツールではなく教員にあります。
セットアップでは現在、自動化された処理が関わっていることを学生に伝えるつもりかどうかも尋ね、編集可能な文言を提示します。回答は記録されますが、それによって作業が止まることはありません。
今後の展開
この手法の本質は採点そのものにあるのではありません。もっともらしいが誤った結果が高くつく、あらゆる反復的で重要度の高いタスクにおいて、エージェントにどう指示を与えるかという問題です——プレーンなファイルによる階層化された指示、セッションを越えて残るメモリ、そして捕捉した失敗を一つひとつルールへと変換する書き戻しループ。採点を実証の場としたのは、それがまさに最も見抜きにくい誤りを罰する分野だからです。コードレビュー、コンプライアンス監査、契約書レビュー向けのテンプレートも同梱されています。
完全に合成されたデータによる12〜18分のデモも用意されています。7つの欠陥を仕込み、自らそれを探し出させる仕組みで、そのうち一つはどんな根拠でも決着がつかないように意図的に設計されています——ハーネスはそれを検証不能としてフラグを立て、人間に差し戻します。これはデモンストレーションが取りうる最も誠実な振る舞いです。フィードバックは大歓迎です。特に、この仕組みはうまくいかないほうがいいと考えている方からのご意見を歓迎します。
サイト · できないこと · GitHub · CC BY 4.0
発案はIra Winder(アイラ・ワインダー)、その後の開発・保守はJoeが担当しています。
関連: AI in educationは、本プロジェクトの元になった研究です——限界について誠実に語ることこそが興味深い部分であるという同じ主張に、ここでは成果物が伴っています。probability tutorialは、同じ考え方を評価ではなく説明に適用するとどうなるかを示すものです。