本地大模型可观测性工具 LLMxRay 开源
LLMxRay 是一款面向本地大模型的开源可视化可观测性工具,支持实时 Token 流式监测、响应质量检查、性能分析与云端等价成本估算。工具完全在本地运行无需云端 API Key,深度适配 Ollama 后端,内置用于分析提示词 KV 缓存命中损耗的 Cache Lab、多模型横向对比、协议差异分析以及本地 RAG 检索可视化功能。用户可通过 npx 或 Docker 命令在本地快速启动。
推荐理由:针对本地大模型运行的黑盒问题,该工具提供了流式生成延迟与提示词缓存命中的可视化诊断手段,便于开发者优化推理性能。