29 6月3 分钟你装的 Ollama,在多用户场景下会慢 20 倍——但这不是它的错你装了 Ollama,跑个 Qwen3 8B。一个人用,很流畅。然后给团队搭了个内部 chatbot。三个人同时用——卡炸了。你以为是模型太大,换了更小的模型。还是卡。这时候你可能开始怀疑:是不是 Ollama 性能不行?不是。问题 …