定義
AIの最近の出力を保存するメモリ層であり、類似した将来のリクエストに対して、高コストなモデルを再実行する代わりにキャッシュから回答を提供する。これによりチャットボットは高速かつ低コストになるが、キャッシュが誰の所有物かを混同すると、ある顧客のプライベートな会話が別の顧客に配信され得る。広く使われているLiteLLM AIゲートウェイでの侵害により、キャッシュされたツール結果がユーザーのエージェント操作を乗っ取るために悪用される可能性も示された。
なぜ重要か
キャッシュはリーダーが求める速度とコスト削減を実現するが、それは顧客とモデルの間に直接位置する。キャッシュのバグは、静かにあるテナントのデータを別のテナントに渡し得る。