<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>MLX on Zampo Blog</title><link>https://blog.cpdd.fyi/tags/mlx/</link><description>Recent content in MLX on Zampo Blog</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Mon, 29 Jun 2026 20:00:00 +0800</lastBuildDate><atom:link href="https://blog.cpdd.fyi/tags/mlx/index.xml" rel="self" type="application/rss+xml"/><item><title>你装的 Ollama，在多用户场景下会慢 20 倍——但这不是它的错</title><link>https://blog.cpdd.fyi/posts/ollama-vllm-local-llm-guide/</link><pubDate>Mon, 29 Jun 2026 20:00:00 +0800</pubDate><guid>https://blog.cpdd.fyi/posts/ollama-vllm-local-llm-guide/</guid><description>&lt;p&gt;你装了 Ollama，跑个 Qwen3 8B。一个人用，很流畅。&lt;/p&gt;
&lt;p&gt;然后给团队搭了个内部 chatbot。三个人同时用——卡炸了。&lt;/p&gt;
&lt;p&gt;你以为是模型太大，换了更小的模型。还是卡。&lt;/p&gt;
&lt;p&gt;这时候你可能开始怀疑：是不是 Ollama 性能不行？&lt;/p&gt;
&lt;p&gt;不是。问题根本不在于 Ollama 快不快。而在于你把它用在了它不被设计服务的场景里。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="一个人-vs-三个人不是慢一点是架构决定的"&gt;一个人 v.s. 三个人，不是「慢一点」，是架构决定的&lt;/h2&gt;
&lt;p&gt;先说一组数据。同一块 GPU，跑同一个模型：&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;并发数&lt;/th&gt;
 &lt;th&gt;Ollama（总 tok/s）&lt;/th&gt;
 &lt;th&gt;vLLM（总 tok/s）&lt;/th&gt;
 &lt;th&gt;差距&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;1&lt;/td&gt;
 &lt;td&gt;~62&lt;/td&gt;
 &lt;td&gt;~71&lt;/td&gt;
 &lt;td&gt;~1.1x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;8&lt;/td&gt;
 &lt;td&gt;~82&lt;/td&gt;
 &lt;td&gt;~187&lt;/td&gt;
 &lt;td&gt;~2.3x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;50&lt;/td&gt;
 &lt;td&gt;~155&lt;/td&gt;
 &lt;td&gt;~920&lt;/td&gt;
 &lt;td&gt;~5.9x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;100+&lt;/td&gt;
 &lt;td&gt;封顶&lt;/td&gt;
 &lt;td&gt;继续涨&lt;/td&gt;
 &lt;td&gt;~15-20x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;一个人用，Ollama 和 vLLM 几乎一样快。&lt;/p&gt;
&lt;p&gt;两个人开始，vLLM 慢慢拉开距离。&lt;/p&gt;
&lt;p&gt;五十个人？Ollama 的吞吐量基本封顶了——请求在排队，后来的等着前面的完成才能开始。vLLM 还在涨。&lt;/p&gt;
&lt;p&gt;这不是 Ollama「性能不行」。「性能」这个词让你觉得是优化做得不够，换个版本、换个模型、换个量化格式就能追上。但这不是优化问题——是&lt;strong&gt;架构不为此设计&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;Ollama 做推理的方式很简单：来一个请求，生成完，再来下一个。它不做 continuous batching。&lt;/p&gt;
&lt;p&gt;什么叫 continuous batching？想象一个收银台。传统做法：排一队，一个一个结。轮到你才开始，结完才叫下一个。&lt;/p&gt;
&lt;p&gt;Continuous batching 的做法：柜台一有空位，就让新人进来。不等前面的人全结完。柜台利用率直接拉满。&lt;/p&gt;
&lt;p&gt;vLLM 就是这样调度请求的。每一轮推理迭代，它重新看一遍「现在谁还需要计算」，有空位就把新请求塞进去。GPU 利用率从 ~50% 拉到 85-92%。&lt;/p&gt;
&lt;p&gt;Ollama 的设计目标从来不是「服务多用户」。它的价值是另一件事——让开发者用一条命令跑起一个模型。&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama pull qwen3:8b
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama run qwen3:8b
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;两条命令，从选模型到本地 API，全程不超过两分钟。这个体验就是 Ollama 的核心竞争力。&lt;/p&gt;</description></item></channel></rss>