定义 内存层,用于存储AI最近的输出,以便未来相似的请求直接从缓存中回答,而无需重新运行昂贵的模型。它让聊天机器人更快、更便宜——但如果缓存混淆了不同用户的归属,一个客户的私密对话可能会被提供给另一个客户。广泛使用的LiteLLM AI网关中出现的一次漏洞表明,缓存的工具结果甚至可以被用来劫持用户的代理操作。 影响分析缓存带来了领导者想要的速度和成本节省,但它直接位于客户和模型之间;缓存的一个错误可能悄悄地将一个租户的数据交给另一个租户。