新メンバー受け入れで効くAI記憶の障害復旧|続きから動ける運用設計
新メンバーの受け入れでは、最初の成功より「途中で失敗した時に安全に戻れるか」が重要です。手順を教えるだけでは、timeout後の再実行、誤った権限、完了済み工程のやり直しを防げません。AI記憶へ復旧の考え方を組み込み、初めて担当する人でも結果不明を二重処理へ変えない運用を作ります。
オンボーディングに復旧訓練が必要な理由
教材は正常系に偏りがちです。どのボタンを押すかは学べても、応答が返らない、保存直後に画面が閉じる、権限が不足する、といった境界で判断できません。新メンバーは失敗を取り戻そうとして同じ操作を繰り返し、公開や通知を二重化しやすくなります。
復旧記憶は失敗を隠すものではありません。どこまで終わったか、外部writeがあったか、次に読む証拠は何かを明示し、担当者が変わっても同じ判定へ到達できるようにします。会話ログ全量より、現在状態と未完了一手が重要です。
最初に渡す四つの地図
一つ目は目的と完成形、二つ目はCurrentや台帳などの正本、三つ目は公開・費用・権限に関する停止線、四つ目はrollbackと相談先です。ツールの操作説明はこの地図の後に置きます。何のための操作か分からなければ、失敗時に守る対象も選べません。
地図には読む順番も付けます。正本、最新checkpoint、対象state、receipt、公開面の順など、案件ごとに確認順を固定します。古いチャットを最初から読み直す前提にすると、失効済みの指示へ戻る危険があります。
結果不明を三つの場面へ分解する
送信前の失敗は、入力検査や認証で止まり外部へ届いていない状態です。送信後・応答前の失敗は、provider側の結果が分からず最も注意が必要です。応答後・保存前の失敗は、外部では成功しlocal台帳だけが遅れている可能性があります。
この三つを同じ「エラー」として覚えると、再試行方針を誤ります。各phaseに、request ID、対象ID、開始時刻、冪等キー、state前後、受領媒体の保存先を結びます。不明な箇所は推測で埋めず、未確認として次のread-only確認へ渡します。
復旧カードを一枚で読める形にする
- 対象案件と一意な対象ID
- 完了済みphaseと未完了phase
- 実行済みの外部write
- 結果が不明になった時刻と原因
- 確認したstate、URL、receipt、lock
- 次の一手を一つだけ
- 再実行してはいけない操作
- rollback対象と対象外
- 復旧後の利用者側readback
このカードにsecret本文や個人情報を貼りません。必要なcredentialは保護された参照名で示し、アクセスできない場合は権限付与を推測せず担当者へ戻します。
練習ケースは安全なlocal環境で作る
最初の演習では、記事draftの保存がtimeoutした想定を使います。受講者は再送せず、対象slug、draft一覧、保存履歴、local receiptを確認します。すでにdraftが一件あれば再作成せず、不足する画像設定だけを次の一手にします。
次の演習では、外部送信前に入力検査で拒否されたケースを扱います。外部writeがゼロと証明できた時だけ、修正済み入力を新しい実行単位で一回送ります。二つのケースを比較することで、同じtimeout表示でも復旧方法が違うと理解できます。
新メンバーが行う復旧の七手
- 影響が増える対象操作だけを止める。
- 現在の正本とcheckpointを再読する。
- process、lock、receipt、外部stateを確認する。
- 完了済みphaseを再開計画から外す。
- 未完了の次の一手を一つに固定する。
- 必要なら新しいauthorityで、その一手だけを実行する。
- 対象機能、対象外差分、滞留、重複、次回triggerを読む。
停止は調査まで止める意味ではありません。公開が不明なら公開操作は止めつつ、local stateや公開URLの確認は続けます。正常な別案件や別routeまで包括停止しないことも演習で確認します。
受領確認で「教えた」を「できる」に変える
資料を送っただけではオンボーディング完了にしません。新メンバー自身が、正本を特定し、完了済み工程を飛ばし、次の一手と戻し方を説明できるかreadbackします。説明者の言葉を暗記するのではなく、実ファイルとstateを根拠に答えられることが合格条件です。
質問が出たら個人の理解不足として終えず、教材のどこに判断材料が足りなかったかを記録します。曖昧な「状況を確認する」を、確認対象と判定条件へ直します。次の受講者が同じ場所で迷わないことが、復旧記憶の改善です。
復旧後の終点を明確にする
エラー表示が消えただけでは復旧ではありません。対象機能が利用でき、意図しない副作用がなく、滞留と重複が整理され、利用者側の実物が正しいことを確認します。さらに次の自然triggerが一回正常に動くまで追跡する案件もあります。
応急処置と恒久対策は分けます。利用者影響を戻す狭い修復を先に閉じ、その後で監視や教材更新を行います。恒久対策の完成まで正常経路を止め続けると、復旧訓練自体が事業停止の原因になります。
よくある質問
初心者には再実行させない方が安全ですか?
一律禁止ではなく、結果不明時の確認順を教えます。外部writeゼロが証明でき、権限と対象が一致する場合は、新しい実行単位で一回だけ進められます。
checkpointには全ログを貼りますか?
いいえ。完了phase、未完了phase、実行済みwrite、証拠、次の一手、rollbackを短く残します。詳細ログは参照先を分けます。
復旧演習は本番で行う必要がありますか?
まずlocal、draft、dry-runで代表ケースを再現します。本番canaryが必要な場合も、対象と件数、戻し方、承認境界を別に固定します。
参照した一次資料
OpenClawのMemory文書は、利用者が読んで修正できるMarkdown記憶を案内しています。W3C PROV-Oは成果物、活動、担当主体の由来を関係として表現します。NIST AI RMF 1.0はGovern、Map、Measure、Manageの機能を通じ、リスク対応を継続的に管理する考え方を示します。
復旧手順は対象システムの仕様、契約、権限に合わせる必要があります。この記事は特定製品の動作や法的義務を断定するものではありません。
あわせて読みたい
AIと記憶の関係を研究する実録から、エージェントメモリーズ開発秘話まで。記憶を持つAIのつくり方を綴っています。
ほかの記事を読む Agent Memoriesを見る