ソートリーダー
不完全なテストのAIの4つの高額な失敗

企業が人間の厳格な監視なしにAIを導入すると、基本的に非決定的な自動システムに自己検証を求めることになる。
問題は、AIがテストに悪いということではない。AIは、特に明示的に設定したルールに従うことに関しては優れている。ただし、実際にブランドを損なう失敗は、人間の判断が最も重要な領域にある。返品ポリシーに関する幻覚。敏感な苦情に対するブランド外の応答。圧力に耐えられないセキュリティガードレール。
企業の 70%の顧客が、悪いAIとの1回のやり取りの後、切り替えることを検討するため、賭けは高くなっている。ただし、多くの企業は、決定的なソフトウェア用に設計された古いまたは自動のみのツールによって検証されたAIを出荷している。そのスタックは、実際に人々を遠ざける失敗を捕捉するように設計されていない。
テスリオが実行したエンタープライズチームのエンゲージメントを通じて、4つの失敗モードがほとんどの顧客に見える損害を占める。どれも自動テストのみでは捕捉されない。
1. 実際にガードするセキュリティガードレールが無い
顧客がチャットボットに正しい質問を正しい方法で尋ねる。ボットは彼らに1000ドルのアイテムを10ドルで提供する。あるいは、絶対に公開してはいけない情報を公開する。あるいは、誰も境界条件をテストしなかったため、基本的なビジネスルールを破る。
リスクは明らかだ。損害は即時的であり、損害は公開される。
実際の問題は、自動化だけが原因ではない。ガードレールは標準化されていないため、特定のビジネスコンテキストに合わせて調整する必要がある。また、ベストプラクティスに従っていても、ガードレールは脆弱のままである。”詩的脱獄”などのテクニックは、ガードレールがその製作者が予想したことのない方法で操作できることを示している。企業が問うべき質問は、”ガードレールが業界標準に従っているか”ではなく、”このモデルはどのように操作できるか”である。
これには対立的な思考が必要だ。ガードレールの設計と攻撃面を理解している、創造的で探究的な人間が必要だ。エッジをテストし、ストレステストを行い、複雑な質問をする。これは、コンプライアンスに合格するガードレールと実際に機能するガードレールの違いだ。
2. 幻覚の中に隠された精度とビジネスロジックの失敗
現実は、AIは幻覚を見るということだ。私は、特定の分野にドメインの専門知識があると、幻覚をすぐに気付く。見え透くしている。
しかし、内部チームに頼ることの重要な欠陥は、盲点があることだ。製品を内側から外側まで知っている場合、正しい答えを得るために何を尋ねるかを正確に知っている。探していない限り、不正確さを見つけることはできない。内部チームは、製品がどのように機能するかを知っているが、実際のユーザーにとってどのように機能するかを知らない。実際のユーザーは、異なる精神モデル、異なるコンテキスト、そしてあなたの仮定を破るさまざまな方法を持っている。
そこで、システムに新鮮なアプローチで臨む人々からの監視が必要になる。彼らは、AIがあなたが指示したことを行うことを検証するだけでなく、さまざまな部門に関心がある可能性のある問題を浮き彫りにし、現実世界での失敗の領域を強調する。
企業が主要な大規模言語モデルを積み上げて、独自のプロセスとワークフローを追加するとき、テスト要件はさらに重要になる。
3. 利用可能性とユーザーエクスペリエンスの見落とし
感じるのは正しいか。見た目は正しいか。支払い処理には少し時間がかかるか。応答は、苛立っている顧客にとって適切な口調を持ち、初めてのユーザーにとって適切なペースを持っているか。
これらは、自動化ツールが答えることができない質問である。また、これらは顧客にとって非常に重要な質問である。
テストスイートに合格することと、実際に優れていることの間には根本的な違いがある。AIのやり取りは、受け入れ基準のすべてのチェックボックスにチェックを入れることができながらも、ユーザーに誤ったと認識される可能性がある。技術的には正しいが、組織的に不器用である可能性がある。正確な情報を、間違ったリズムやトーンで提供する可能性がある。
ここで、人間の介入が不可欠である。AIの失敗を認識するように訓練された人々が必要だ。顧客が住む地域で、実際に使用するデバイスや支払い方法でテストする必要がある。サンフランシスコの高性能iPhoneでテストする人と、ジャカルタのミッドレンジアンドロイドでテストする人とは、体験が異なる。テスターの多様性がなければ、シミュレートされた結果が得られ、製品が現実に触れた瞬間に失敗することになる。
実際に製品を使用し、実際に体験の意味を考える、実際に何かが間違っている場合に異議を唱える人々が必要だ。
4. 検証された専門知識の幻覚
これは最も微妙な失敗であり、そしておそらく最も危険なものだ。企業が適切なテストなしにAIを導入すると、AIがドメインを適切に処理するために必要な知識を吸収したと賭けている。AIが何かについて自信を持って話すことができれば、確かにそれについて話すことができるはずだと思っている。
しかし、もう1つの次元のリスクがある。AI機能を使用するほとんどの人は、同じ仮定を立てている。出力に疑問を抱いていない。権威的に聞こえ、明らかに間違っていない場合、信頼している。悪い医療アドバイス。誤った法的ガイダンス。欠陥のある財務の勧告。結果は、ユーザーがAIを正しいと仮定し、疑問を持つ理由がない場合に悪化する。
AIは、すでに実行されたことについては優れている。新しい状況では何が行われるべきかを知ることはできない。すべてのビジネスには新しい状況がある。すべての製品にはエッジケースがある。すべての顧客ジャーニーには、AIが提供する正しい答えではない答えを必要とする瞬間がある。
リリースの準備を再定義する
成熟したAIリリース戦略には、自動化のみの思考を超えて、人間の介入による専門知識の構造化フレームワークを構築することが含まれる。
- エンジニアリング:このチームは、システムの完全性を所有し、モデルとインフラストラクチャのレイヤーでの失敗の見かけを定義し、ガードレールを配置する必要がある場所を決定する責任がある。
- 製品:リーダーは、AIが自律的に行うことができる決定、人間の承認が必要な決定、そしてAIが触れてはいけない決定の境界を所有する責任がある。
- デザインとQA:これらの専門家は、ユーザーエクスペリエンスを所有する責任がある。ユーザーは、AIが何をしているかを理解し、間違っていることを認識し、間違っている場合は有意義な救済措置を講じることができる。
私たちは、AIが顧客にとって信じられない体験を作ることができることを認識しなければならないが、AIは自身の判断者や陪審員にはなり得ない。AIの品質の責任は、組織全体にわたるものであり、チームを跨いで、人間の専門知識に根ざし、現実世界のテストに基づいている。












