如何使用硬件分析器

GPU 与显存兼容性检测器是一个免费的、基于浏览器的工具,能准确告诉你的电脑可以运行哪些本地 LLM。选择你的 GPU 或使用自动检测,输入显存和系统内存,它会立即列出每个兼容模型,并显示显存占用、每秒 token 数估算、电费估算,以及一键 Ollama 安装命令——无需注册,数据不会离开你的设备。

使用方法

  1. 选择你的 GPU——从下拉菜单中选择,或点击自动检测以从浏览器读取你的硬件。
  2. 设置显存和系统内存——Apple Silicon 用户请输入统一内存总量。
  3. 选择你的用途——每日使用时长和工作负载会调整速度与电费估算。
  4. 查看匹配结果——模型会被分为流畅运行、可运行和无法容纳三类,每个都附带可复制粘贴的 Ollama 命令。

显存速查指南

4 GB VRAMLlama 3.2 3B, Phi-3.5 Mini, Gemma 3 4B (Q4), SmolLM2
6–8 GB VRAMLlama 3.1 8B, DeepSeek R1 8B, Qwen 3 8B, Phi-4 Mini
12–16 GB VRAMLlama 4 Scout (Q4), Qwen 3 14B, Mistral NeMo 12B
24 GB VRAMLlama 3.3 70B (Q4), DeepSeek R1 32B, Mistral Small 3.1

Shopping rather than checking? The hardware tracker ranks every GPU, laptop and AI station by the memory that decides what fits and the bandwidth that decides how fast it runs.

常见问题

运行本地 LLM 需要什么硬件?
最低配置需要一块拥有 4–6 GB 显存的 GPU,或一台拥有 8 GB 以上统一内存的 Apple Silicon Mac,即可流畅运行 3B–8B 的小模型。中等规模的 13B–34B 模型需要 16–24 GB 显存,而 70B 模型在独立 GPU 上大约需要 24 GB 以上(或 Mac 上 48–64 GB 统一内存)。你还需要足够的系统内存——最低 16 GB,推荐 32 GB——因为操作系统和从 GPU 卸载的层都存放在这里。上方的检测器会将你的 GPU 和内存与 75+ 模型逐一匹配,让你无需猜测。
7B、13B 或 70B 模型需要多少显存?
以 Q4_K_M 量化为经验法则,7B 模型约需 5–6 GB 显存,13B 模型约需 9–10 GB,70B 模型约需 40–48 GB。升到 Q8 大约会使这些数字翻倍,而完整的 FP16 大约会翻两番(70B 在 FP16 下需要约 140 GB 和多块 GPU)。此外还要预留 1–2 GB 用于上下文/KV 缓存,若使用长上下文窗口则需更多。在 Apple Silicon 上,模型使用统一内存而非独立显存,因此一台 64 GB 的 Mac 可以在 Q4 下运行 70B 模型。
量化模型与全精度模型有什么区别?
全精度模型将每个权重保存为 16 位浮点数(FP16/BF16)——这是它们训练时的格式,质量最高。量化模型将这些权重压缩为 8 位、4 位或更低,将显存占用减少 2–4 倍,而质量下降通常很小且难以察觉。例如,一个 7B 模型会从 FP16 下的约 14 GB 缩小到 Q4_K_M 下的约 4.5 GB。除非你在做微调或研究评测,否则 4 位或 5 位量化都是本地推理的正确选择。
LLM 的最佳温度设置是多少?
温度控制随机性:数值越低,输出越聚焦、越可复现;数值越高,输出越多样、越有创意。事实性问答、编程和数据提取使用 0.0–0.3;一般聊天和助手使用 0.6–0.8;头脑风暴或创意写作使用 0.9–1.2。大多数工具默认约为 0.7–0.8,这是一个合理的起点。如果你想要更多样性,通常调整 top_p(核采样)比把温度调得很高更好。
运行本地 LLM 是免费的吗?
软件是免费且开源的——Ollama、LM Studio、llama.cpp 以及开放权重模型本身,下载和运行都不收费。你唯一真正的成本是硬件(一块 GPU 或一台够强的 Mac)以及为其供电的电费,通常每 1,000 个 token 只需不到一美分。与云端 API 不同,这里没有按 token 计费、没有速率限制,你的数据也永远不会离开你的机器。对于每天稳定使用的人来说,本地方案通常几个月内就能回本——本站的成本计算器可以估算你的确切回本时间。
如何在 Ollama、LM Studio 和 llama.cpp 之间选择?
llama.cpp 是大多数本地工具所基于的底层推理引擎——如果你想要最大的控制力、脚本能力以及最新的命令行功能,就选它。Ollama 将 llama.cpp 封装成简单的命令行工具,外加一个带有 OpenAI 兼容 API 的后台服务,是希望从代码中调用模型的开发者的最简单选择。LM Studio 是一款精致的桌面图形界面应用,带有模型浏览器和聊天界面,非常适合初学者或喜欢点击胜过打字的人。三者都免费、运行相同的 GGUF 模型文件,并且可以在同一台机器上共存。
没有 GPU(仅用 CPU)能运行本地 LLM 吗?
可以——Ollama 和 llama.cpp 都支持仅 CPU 推理,对小模型效果不错。在现代多核 CPU 上,速度大约为每秒 1–8 个 token,而独立 GPU 则为 30–100+,因此它适合短提示,但生成长文本会较慢。由于整个模型加载到系统内存而非显存中,7B 模型请预留至少 16 GB 内存,13B 模型请预留 32 GB。为获得最佳的纯 CPU 体验,请坚持使用 Q4 量化的 3B–8B 模型。
应该选择哪种量化——Q4、Q8 还是 FP16?
Q4_K_M 是最佳的全能默认选择:它将显存占用比 FP16 减少约 4 倍,而质量损失在日常使用中难以察觉。如果你有富余的显存并想要更高一点的准确度,可升到 Q5_K_M 或 Q6_K;若追求近乎无损的输出,可选 Q8_0,其体积约为 Q4 的两倍。将完整的 FP16/BF16 留给微调、评测或对每一位精度都很看重的研究。低于 Q4(Q3、Q2)时文件会继续缩小,但模型开始明显出更多错误,因此只有在模型否则装不下时才使用。