什么是「大语言模型」
一句话:大模型是一台被千亿级文本「喂」出来的概率机器, 学会的不是记课文,而是词语之间的规律与共现结构。它不是数据库,而是「压缩了世界的统计大脑」。
关键零件:
Token 化 → Embedding(嵌入) → 若干层
Transformer 块(含自注意力/前馈) → 输出概率分布。
"hello 世界" --> [ Tokenizer ] --> [1024, 98]--+
(切成词元) v
每个 Token ---> [ 映射成高维向量 ] . 位置编码
v
+--------- Transformer x N 层 ----------+
| . 多头自注意力: 谁和谁有关? (Q/K/V) |
| +-- 长程依赖的真凶, 也是显存大户 KV |
| . 残差 + LayerNorm + RoPE 旋转位置 |
| . 前馈网络 FFN: 参数量最大的"记忆仓库" |
+--------------+-----------------+--------+
v v
Logits -> Softmax --> 下一个 Token 概率分布
|
argmax / top-p 采样 --> "的世界你好x"
(这就是你会看到的文字)
显存两大开销:①权重(烤炉)②运行时动态增长的 KV-Cache(随对话变长的临时上下文缓存)。
理解了这两块,后面所有「显存量化」逻辑就不攻自破。
为什么要把模型「请回自己家」
把每一次 Prompt 都外包给云端,本质上是在向第三方裸奔你的思考。
本地部署换回的,是主权、隐私、可控与一条不牵线的离线自由。
| 维度 | 云 API | 本地自部署 |
|---|---|---|
| 隐私 | 数据出域 / 条款不确定 | 完全可控 · 不出设备 |
| 可用性 | 依赖网络与账号 | 断网可用 |
| 成本模型 | 按 token 计费 · 高峰可能排队 | 硬件一次投入 · 后续≈电费 |
| 定制/微调 | 受限 | 全自由 |
| 模型上限 | 云端最大、最全、最前沿 | 受本地 VRAM/内存限制 |
| 维护 | 零维护(别人干) | 要自己配环境、升级、对抗幻觉 |
硬件:显存决定你能养多大的「脑子」
本地部署最大的物理定律是 VRAM(显存)。 别急着买卡,先用一条公式把你的需求算明白——再谈别的。
可装下? ── WH ≈ 参数量(B) × 每权重量化比特 ÷ 8 [+ 2~4GB 运行时/KV 缓冲] 范例:Qwen3-14B 跑 Q4_K(≈每个权重 ~0.61 字节) → 权重基准 ≈ 14 × 0.61 ≈ 8.5 GB + 系统/KV ≈ 1~3 GB → 至少需要 ~12GB 显存的显卡才能舒服拖动(上下文越长,KV 越多,需求上浮)
关键结论:吃显存的是「参数量 × 精度」,而不是「模型多聪明」。 让你舒舒服服跑 8B 推理的门槛,眼下已经低到 6–10GB 显存(或纯 CPU + 大内存也行,就是慢)。
| 你的显存(大致) | 甜点区模型(Q4 量化后) | 说明 |
|---|---|---|
| < 6GB(核显/旧卡) | 1B–4B:Qwen3-1.7B/4B、Llama3.2-3B、Phi-4-mini、Gemma-2B | 纯 CPU 也行,图一乐 / 端侧 |
| 8–12GB(2060/3060/RX6xxx) | 7B–8B,Qwen3-8B、DeepSeek-R1-7B/8B、qwen coder 7B | 入门甜点。很能打了 |
| 16–24GB(4060Ti-16/4070Ti/4080/4090) | 14B–34B:Qwen3-14B/32B、R1-14B/32B、Gemma3-27B | 一卡横着走,香 |
| 24–48GB(7900XTX 双卡/4080 双卡) | Qwen3-30B 系 / R1-32B 大 ctx / MoE 235B 或 70B Q5 | 工作站分水岭;启 Agent/RAG |
| ≥ 2×24GB 或多卡大显存 | 70B 级 Q4 或 MoE-Large(R1-70B、LLaMA3.3-70B、Qwen3-235B 邻居) | 多卡拼接加速,进入玩票/小服务器领地 |
llama.cpp / Ollama 都支持纯 CPU;想加速再开启 AVX2 / Apple 的 Metal / AMD 的 Vulkan 等。模型武器库:近一年可本地部署的开源强模型
只挑「个人 PC / 小型工作站 跑得动、且血统开放、口碑能打」的。 显存均按量化后估算;追求精度请直接看官方仓库与许可。
部署实战:把模型真正「装进」机器里
新人一律推荐 Ollama(一条命令极简)或
LM Studio(图形化拖拽);追求性能与定制再上 llama.cpp / vLLM。
下面四套,由易到难,都讲透。
主链路 · Ollama(Win / macOS / Linux)
# 1) 安装:https://ollama.com/download (win/mac 下载即用)或 Linux: $ curl -fsSL https://ollama.com/install.sh | sh # 2) 拉取并跑一个模型(自动量化下载)| 例如中文超好用的 7B 全家桶 $ ollama run qwen3:8b >>> 你好,这里是 100% 本地。😎 # 3) 换一个「会思考」的:DeepSeek-R1 蒸馏系 $ ollama run deepseek-r1:8b # 4) 查看本地模型 / 退出 / 设置并发与上下文 $ ollama list # 已装清单 $ /bye # 会话内退出 $ env OLLAMA_CONTEXT_LENGTH=32768 ollama run qwen3:8b
# 验证服务起没起: $ curl http://localhost:11434/api/tags {"models":[{... "name":"qwen3:8b" ...}]} # 抛一条最简请求: $ curl http://localhost:11434/v1/chat/completions -H "Content-Type: application/json" -d '{ "model": "qwen3:8b", "messages": [{ "role": "user", "content": "讲个只有极客懂的冷启动段子" }] }' # 于是:把 .env 里的 OPENAI_BASE_URL 指向本机即可让几乎所有客户端倒向本地 # 例(Python/OpenAI SDK):OpenAI(base_url="http://127.0.0.1:11434/v1", api_key="ollama")
qwen3 8b 或 deepseek r1 →
挑一个 GGUF 标签(喜欢 Q4_K_M)→ Download → 点 Chat / 右上角 Local Server
即得 `http://localhost:1234` 的 OpenAI 兼容端点。全程鼠标,适合给女朋友/非技术队友演示。ollama pull qwen3:8b-q4_K_M;想更省更慢可 -q3,更准 -q8。
HuggingFace 上很多发行商直接给 Qwen_Q3/…_K_M.gguf 单文件,下好一句
ollama create name -f ./Modelfile 即可注册成本地模型。
③ llama.cpp —— GGUF 单文件 + CPU 也能跑
# 0) 编译/或从 GitHub Releases 拿现成二进制(ggml-…-bin) $ git clone --depth 1 https://github.com/ggml-org/llama.cpp && cd llama.cpp $ cmake -B build -DGGML_NATIVE=ON && cmake --build build --config Release -j # 1) 拿到一个 .gguf(比如从 HF 下载) wget https://…/models/…/qwen3_8b_q4_k_m.gguf # 2) 纯 CPU / -ngl 可指定显存层数;-c 上下文;-t 线程;--jinja 用原生模板 $ ./build/bin/llama-server -m ./qwen3_8b_q4_k_m.gguf \ --port 8080 -c 8192 -t 8 --jinja [..] server is listening on http://0.0.0.0:8080 # 3) 结构化 LLM 应用通常走这里的 /v1/chat/completions 或 /completion $ curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d \ '{"model":"qwen3","messages":[{"role":"user","content":"hi"}]}' # 技巧:OLLAMA_… 省事;llama-server 优势是可控内核参数量与流式 / 输出 JSON schema(guided)
④ vLLM —— 当你想要「生产线级吞吐」
# 需要一只 NVIDIA / 好 CPU 环境,Python3.10+;Windows 建议 WSL2 或 Docker $ pip install vllm # 拉起例如 Qwen 或 LLama 等 HF 权重: $ python -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen3-8B \ --gpu-memory-utilization 0.9 \ --max-model-len 16384 \ --port 8000 INFO: Started server process … http://0.0.0.0:8000 # 然后它就是一个 OpenAI API —— curl 测一发 $ curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" \ -d '{"model":"Qwen/Qwen3-8B","messages":[{"role":"user","content":"写两句 hello world 讲讲"}]}' # 进阶组合拳: batch(packing) 超长 ctx / 前缀缓存 / speculative decoding / tensor-parallel=2 多卡
| 引擎 | 上手 | 强项 | 适合谁 | 平台注意 |
|---|---|---|---|---|
| Ollama | ★极低 | 命令端极简 · 自动量化 · 生态广 | 新手 / 80% 场景默认解 | Win/mac/Linux 原生 |
| LM Studio | ★GUI | 可视化试模型 · 端点一键起 | 桌面党 / 演示 | Win/macOS |
| llama.cpp | ★★★ | GGUF 底层控制 · CPU 兼容最佳 | 深度定制 / 老机器 | Win 需 Git/CMake |
| vLLM | ★★★★ | 高吞吐批量 · OpenAI 服务化 | 生产 / 多人小服务 | 建议 CUDA / WSL2 |
| Docker(jetson 等) | ★★ | 环境隔离 · GPU passthrough | 换机免折腾 / 试玩镜像 | Win 走 WSL2 backend |
Metal,跑 8B 又快又省电。
Ollama/llama.cpp 均已原生支持;别听信「Mac 不能跑 AI」的过时笑话。选模型记得看 `Metal / GGML` 优化。ollama show 或运行极慢多半是没走 GPU——
确认 ollama ps 里的 PROCESSOR 是 GPU。逐项排了再往下。量化深水区:如何「压缩」你的钢铁之心
同样一个模型,Q8 与 Q3 的差距不在文件个头,而在「每一句会不会走样」的边缘。 搞清楚原理,你就能在 体积 × 速度 × 手感 之间站稳自己的支点。
Q4_K_M 或 Q5_K_M 就跑这些,别为 2% 手感赌脸;②吃紧就降上下文而非降比特——KV 瘦身(如 KV-quant)
常比砍权重更划算;③代码/长推理要求高时,宁可用 L+KV-quant 或升一档容量,也别 Q3。避坑指南:我替你踩过的坑,就别再踩了
症状 → 成因 → 解法。按「看起来像是哪类问题」点开对应的洞。
■装了却“飞快的胡说” / 乱码火星文+
成因:量化太低(Q2/Q1)或上下文被人为压缩;也可能默认温度过高。
解法:改用 q4_K_M/q5_K_M;把 num_ctx(OLLAMA_CONTEXT_LENGTH)设到 8192+;把 temperature 降到 0.6~0.8;代码任务 top_p 0.9 附近。还乱?换它的原版 F16 试一次定位是“量化伤”还是“数据本就弱”。
■GPU 明明在,却很慢 / Ollama 一直吃 CPU+
成因:没真正落到显卡、驱动或模型层没被识别为可 GPU。
解法:看 ollama ps 的 PROCESSOR 是否显示 GPU;Win 装对应 CUDA 驱动、并用支持的后端;llama.cpp 检查 -ngl 层数与日志里的 offload。别被“已启动”糊弄,眼见为实。
■文件很大:下载一半 / 显存老不够+
成因:你在下载原版 FP16 而不是量化;或上下文被顶到极限把 KV 吃爆。
解法:找 …-GGUF 仓库挑 Q4_K_M;用 -c 4096 起步、再一点点加;实在不够再考虑 KV-Cache 量化或 --flash-attn。想一步到位就选匹配显存档次的模型尺寸。
■客户端连不上本地 / 端口被占 / CORS 报错+
成因:服务没监听 0.0.0.0;或走的还是别家代理;浏览器跨域挡了。
解法:确认端点 curl http://localhost:11434/v1/models 有应答;Web UI 用官方码头或加入 CORS 开关;换浏览器直连 127.0.0.1 排查。断掉 clash/system proxy 再试一次,多半立刻就好。
■OOM 崩溃 / 电脑卡到“幻灯片” / 疯狂 swap+
成因:权重 + KV + 运行时总量超了物理显存,系统退而用内存/磁盘抖动。
解法:降一档模型或比特;压 -c 上下文;开 flash attention & KV 量化;关掉并行 browser/AI 抢显存的进程。仍崩就证明此模型不适合这台机器 —— 换小不丢人。
■多语言:小模型只会讲英文 / 中文答不准+
成因:训练语料英文偏重,小参数量中文覆盖不足。
解法:中文场景优先 Qwen / GLM / InternLM / DeepSeek 家族与中文强化版;提醒自己在模型名带 chat/…zh;小模型不要期待“满血中文学术级”,该换 8B→14B 时别省电。
■下载卡成蜗牛 / 国内访问 HF 不稳定+
成因:huggingface.co 国内直连慢。
解法:用镜像 HF_ENDPOINT=https://hf-mirror.com;Ollama 走其自带且国内可用的分发;必要时 hf download 带 hf_transfer 多线程;先只拉需要的 quantization 文件而非整份快照。
■多人共用老是挤爆 / vLLM 一会儿 OOM 一会儿空转+
成因:没做并发与批量化,所有请求独占 KV 与显存。
解法:服务层加 Continuous batching(Ollama/OpenWebUI 有队列)、限制 max model len,
摊给 tensor-parallel(多卡) 或 data-parallel(多实例);别把 128k 上下文全放给每人。
1> 日志先行 —— 服务端 stdout 一定有线索;
2> 最小复现 —— 去掉 RAG/代理/插件,单裸模型 curl 试;
3> 版本对表 —— Ollama/llama.cpp 是滚动发布,先 ollama update。别一上来重抠代码。调优与生态:从“能跑”到“好用”
部署只是第一步。让吞吐、上下文、工具链与自己握手,才是持续工程的开始。
bench,再动手。kv cache reuse / 前缀缓存 提升长对话跟手度。function-calling:给工具 JS/JSON schema,guided decode/grammar 保证输出合法;
靠 OpenWebUI / LobeChat / Continue(IDE) 等开源前端承接交互,瞬间体验翻倍。LoRA 微调学你的领域、DPO/RMM塑人格、量化前先存 FP16 一份做对照。版本化你的 Modelfile,踩坑可回滚。| 你想达成的目标 | 推荐第一步 |
|---|---|
| 本地 Chat UI 全家桶 | OpenWebUI(容器化+多人+联网搜索插件) |
| IDE 里 AI 编程补全 | Continue / Tabby 指到 localhost 的 OpenAI 端点 |
| 把 AI 接进自己的 Python | OpenAI SDK 换 base_url / 直接 ollama-python |
| 落地到老机器/无 GPU | llama.cpp + Q4 档 + batching |
| 小服务器/生产高吞吐 | vLLM + AWQ + 前缀缓存 + tensor-parallel |
社区/数据 HuggingFace(huggingface.co) · Ollama 模型库(ollama.com/library) · Open LLM 榜单(HF Space) · 各模型的官方仓库许可页
工具/哨兵 Local Remote (本地对比) · 显存计算器 · GGUF-KoboldCpp · CT2-Transformers
权限跳跃点。别让它裸跑 root;容器跑、最小权限、
独立 token、内容沙箱审查;别把私密 key 轻易交给模型生成的代码。玩得野,但要关好后门。MoE 稀疏架构:大又如何「小而省」
▸ 进阶 · 看懂即可DeepSeek-671B、Qwen3-235B / 32B-A3B、GPT-OSS-120B…… 2025 年最会「装」的模型,几乎全是 MoE。 先破一个迷思:「70B」并不可怕——真正进门看的是激活参数。
什么是「专家混合」Mixture-of-Experts CORE
Qwen3-32B-A3B:总参数 32B、激活只有 3B。
它的存储仍要按 32B 塞进显存,但每个 token 的计算只走 3B → 推理快一个量级,还经常打得过稠密 14B。本地要重点看的 MoE 细节 guru
- Experts + Top-K:如
128 专家、top-2——每个 token 被 2 个专家处理,路由器输出稀疏概率。 - Shared/共享专家:部分激活始终在场,兜底通用能力(Qwen3-235B 那类带共享专家的吃显存会略高)。
- 总参 / 激活参标在模型名:
DeepSeek-V3 系 = 671B-A37B、Qwen3-32B-A3B、Qwen3-235B-A22B——-A后面就是“每 token 真用的激活量”。
纯 CPU 玩家若能接受带宽瓶颈,MoE 反而是「少钱买智商」的惊喜路线;GPU 玩家看
-ngl 能否把路由层也装入显存。KV-Cache 与上下文经济学
▸ 进阶 · 本地显存第一大隐形杀手为什么 8k 上下文跑得好好的,一开 128k 就 OOM? 因为每多一个 token,不只是「多存一句话」,而是模型要记住每一层的交互——这笔账,是 KV-Cache 在算。
一笔注定增长的显存 CORE
KV-Cache。一条很唬人的近似式:
KV内存 ≈ 层数 × KV 头数 × 头维度 × 上下文长度 × 每元素字节 × 2(K+V)简化记忆:大体「随上下文 token 数线性增长」,且要与权重并存于显存。
seq_len 线性 → 上下文提高 16 倍,KV 占显存也约 ×16
(分页/量化的进程可再打折)。对 8B 级一般权重大几 GB,长上下文常直接把模型踢出显存。这是 90% 长文 OOM 的真相。长上下文还有第三个坑:速度 guru
- Decode 每步都要把整段历史 key/value 拿出来算注意力 → token 越多,单步越慢(长文末段会明显变卡)。
- RoPE 外推 / 插值:Neo 时代用旋转位置嵌入,把 4k 训练长度的模型“挤出”到 32k/128k——代价是超长段注意力衰减需工程救。
- 长文做题不是“全记住”:RAG 或滑动窗口(summarization+retrieval) 往往比硬塞 128k 又快又准又便宜。
8k / 16k,真需要长资料再 分段检索;② 开 flash-attn,再用 KV 量化抠显存;③ llama.cpp / Ollama 都留 `-c` 显式设上下文,默认值常常骗你。采样手艺人:模型究竟怎么「选词」
▸ 进阶 · 一句话决定像不像 AI同样的模型,有人调到文采飞扬、有人调到冷血数据库——差别全在那几个采样参数。 temperature 只是冰山一角。给程序用的「稳定输出」跟给文案的「有灵感」从不是同一套参数。
先排个优先级 CORE
p 的那堆候选里抽:CPU 上按总概率堆叠,砍掉“跑偏的尾巴”。
兼顾质量又留变化,日常调它最顺手。一份「能直接抄」的任务→配方 guru
| 目标 | temperature | top_p | top_k | 其他建议 |
|---|---|---|---|---|
| 稳定JSON/代码/函数调用 | 0.0–0.2 | 0.9–1.0(主导似 argmax) | 高或关 | 强烈建议配 guided/JSON-schema,见 §12 |
| 通用对话/翻译/总结 | 0.7 | 0.9 | 默认 | min_p≈0.05 防碎词 |
| 创意文案/诗/头脑风暴 | 0.9–1.1 | 0.95–1.0 | 高 | repeat↑ 同句循环别太狠 |
| 事实问答/检索增强(RAG) | 0.2–0.3 | 0.9 | 默认 | 配 top-k、别开过重启发文段 |
| 长回答防“尾巴反复” | 0.6 | 0.92 | 48 | 加 small repeat_penalty 1.05–1.1 |
$ ollama run qwen3:8b --num-ctx 8192 --temperature 0 --num-predict 1024 使用 --temperature 0 得到尽量稳定的输出。 也可在 API 里直接传: { model, messages:[…], "options": { "temperature":0.2, "top_p":0.9, "repeat_penalty":1.1 } } 若换了模型/任务,把配方当起点当刻度,别当真理。
结构化输出与工具:让模型「说人话按程序脾气」
▸ 硬核 · 本地应用联调必备聊天框只是起点。当你让模型去填表、调 API、写数据库,你需要它乖乖吐合法 JSON, 甚至主动请求调用某个工具——这就是结构化输出 + Function-Calling 的地盘。
让生成「按规矩来」:guided decoding PRO
--grammar / --json-schema、vLLM 的 guided_json/grammar 就在做这件事 → 输出结构零非法率。JSON Schema(字段/类型/必填),让引擎“翻译”成逐 token 约束。
结果就是 稳稳的合法 JSON,还能顺带限定字段名与类型 —— 比甩两句“please output valid JSON”可靠一万倍。# A) llama-server 用 JSON-Schema(注意转义) $ ./build/bin/llama-server -m model.gguf -c 8192 \ --json-schema '{"type":"object","properties":{"name":{"type":"string"},"scores":{"type":"array","items":{"type":"integer"}}},"required":["name"]}' 输出即合法 JSON(由引擎在抽词层面背书)。 # B) 任意 OpenAI 兼容端点:OpenAI 客户端传 response_format curl http://127.0.0.1:11434/v1/chat/completions -H "Content-Type: application/json" -d \ '{"model":"qwen3:8b","messages":[{"role":"user","content":"把 MySQL 格式化为 JSON"}], "response_format":{"type":"json_object"},"options":{"temperature":0}}' # C) llama.cpp gguf / ollama(kimi类不原生) tool 声明:用 tools 数组即可让服务端发 tool_calls # 概念:模型不“执行”,只“决定要调 + 填好参数”,真正执行永远在你这边(安全第一)。
玩家通鉴:把大模型领上牌桌的那些人
▸ 番外卷 · 当背景板读懂人本地部署选模型时,真正要盯的是出品方与开源 stance。 这一节把「国内外主流水厂 + 开源编年大事」摊成一幅地图,帮你在牌桌上认人、认线、认下一手牌。
一张表认全大部分玩家 CORE
| 阵营 | 厂商/团队 | 代表模型 | 开源 stance | 本地友好度 |
|---|---|---|---|---|
| 海外 | Meta | Llama 2/3/3.2/4 | 主力开源 | ★★★★★ |
| Google DeepMind | Gemini 系列 + Gemma 开源 | Gemini 闭源 / Gemma 开源 | ★★★☆☆ | |
| OpenAI | GPT / o 系列 / gpt-oss(权重) | 闭源为主,开放 gpt-oss | ★★☆☆☆ | |
| Mistral AI / Anthropic / xAI | Mistral 系 · Claude · Grok | Mistral 开源多 / 后两者闭源 | ★★★☆☆ | |
| 国内 | DeepSeek(深度求索) | R1 / V3(671B-A37B) | 开源先锋,MIT | ★★★★★ |
| 阿里 · 通义(Qwen) | Qwen2.5/3/3-Coder… 全档位 | 全规模高热度开源 | ★★★★★ | |
| 智谱 Z.ai | ChatGLM / GLM-4-9B ※GLM5 等 | 重要开源(部分商业) | ★★★★☆ | |
| 上海AI Lab | InternLM 系列 | 开源全链 | ★★★★☆ | |
| 月之暗面Kimi / MiniMax / 百度 / 字节 | Kimi · MiniMax · 文心 · 豆包… | 以闭源 API 为主 / 少量开放 | ★☆☆☆☆ |
发展大事 Timeline:这 8 年怎么卷到今天的 PRO
细说大厂 · 海外篇
●OpenAI(美国 · 闭源 API + 开放权重两步走)+
来龙:2015 年,马斯克、奥特曼、Sutskever、Brockman 等在加州以「非营利、关心全人类、开源友好」姿态共同创立, 初衷是对冲「逐利的巨头把 AGI 锁进少数公司」。取名 OpenAI 却因安全顾虑对早期权重刻意限制发布(GPT-2 当年“因太危险先不完全公开”的作法,是它后来争议的注脚之一)。
关键节点:2019 引入微软上百亿美元支持转为「封顶盈利」架构;2020 GPT-3 引爆“大不一定笨”的规模律;
2022 年末、ChatGPT 把对话交互带进大众视野,也被认为是 2023 至今“大模型黄金时代”的闸门;
2023/11 董事会突然罢免 CEO 奥特曼又四天内请他回归,是它与“AI 安全派”路线冲突的公开一幕;
随后几年它以 GPT-4 / o 系推理 / 各类旗舰走「闭源高性能 + 付费 API」主线,同时 2024–25 推出能本地部署、开放权重的 gpt-oss-20b/120b(MIT/Apache–社区可跑),也被许多人解读为“被开源族逼着回应”。
中立点评:优势 —— 长期是“工程整合 + 产品化 + 生态”的行标式选择,其系统提示/工具链/评测常常是事实上的对照基准;局限/被批 —— 透明度、数据来源与版权、内容审核边界、军事应用与安全护栏争议多次见报;同时它仍以闭源加锁为变现核心,开放权重尚数“补位”。是非都有公开来源可查(下方出处),慎勿单方情绪。
现役(2026-09 视角):GPT 系 / o 系旗舰仍走 API;本地能实际部署的是 open-weight 的 gpt-oss-20b · gpt-oss-120b(MoE,20B 级量化适合工作站)。
出处与渠道:OpenAI 官网 openai.com;Hugging Face 仓库 `openai/gpt-oss*`(可拉取权重与卡页);Ollama `gpt-oss`:20b / 120b。
●Anthropic(美国 · Claude · 闭源 + 安全叙事)+
来龙:2021 年由前 OpenAI 高管 Amodei 兄妹等核心成员成立,方向从一开始就有鲜明立场——把 AI 的可解释与对齐(Alignment)置于优先级。团队用「宪法式 AI(Constitutional AI)」,用一套价值观再约束 AI 自我训练,这是它与主流“刷榜为主”厂牌最大的差异点。
关键节点:以 Claude 系列迭代(Sunset 的 Obus/Sonnet/Haiku 档次命名沿用至今)。它较早重视超长上下文与“代码/科研工作流”,被不少开发者当主力;到 2025–26,Claude 也不断进入代码 Agent 与一些政军领域的高频使用,随之而来的「安全护栏 vs 授权边界」争论多次登上公开报道(白宫/国防部口径的存在两面,正反都有新闻源)。
中立点评:优势 —— 对齐叙事 + 代码/长文档实测口碑好,产品语言天然接近开发者;受限 —— 全系闭源(无本地权重),依赖 API/订阅变现,且“安全极限到底守多紧、执行对不对”一直是它招黑与招赞的同一刀。
现役(2026-09 视角):API / App 按 Claude 系列订阅使用;无法本地自部署(这是它与开源族的根本分界,选型时先想清)。渠道:anthropic.com / api.anthropic.com Gemini 亦同需看是否给了开源体。
●Google · DeepMind(Gemini 闭源旗舰 + Gemma 开源体)+
来龙:Google 的人工智能研究长期分“学术顶会派(Google Brain)”与“深度强化学习怪才 DeepMind”;2023 年二者合并成 Google DeepMind,又为大模型产品线披上 Gemini。同年以一局 AlphaGo(2016) 先把公众胆量拉满、又靠着 Transformer 论文的团队基因,堪称大模型时代的“原股东”。
关键节点:Gemini 系列以多模态与“全线产品再造(Workspace/搜索/Agent 工具如深度研究)”铺开,2024–2026 迭代到多代、长期占据评测头部;同时发布开源 Gemma 家族(给了可本地运行的小型与中型权重),是对“技术开放但没有全开放旗舰”路线的一个折衷注脚。
中立点评:优势 —— 深度平台整合、多模态底子厚、算力与 To Big-Client 生态;局限 —— Gemini 旗舰闭源、服务多在它自家生态,成第三方开发者“可调但不可控”,开源给到的量级远未到旗舰(Gemma 主打在端侧/中小档)。
现役(2026-09 视角):旗舰走 Gemini API;本地可跑的是 Gemma 系(如 4B/12B/27B 等档)及其编码/多模态衍生。渠道:deepmind.google / aistudio.google.com / Ollama「gemma」。
●Meta(美国 · Llama · 开源生态重镇)+
来龙:Meta(前 Facebook)本不是第一眼的“模型厂”,却在 2023 年靠 Llama 一战成了开源大模型的引擎。它长期以来想攒的是“社区 + 生态 + AI 基建话语权”——通过放权重换取开发者长期粘性与行业标准位置,这是它与“卖 API”派截然相反的打法。
关键节点:Llama(研究用)→ Llama 2(2023 对商用放宽) → Llama 3/3.x(2024–25 多尺寸、堆生态)→ 到 2026 的后续迭代仍延续“开放但自家 Meta AI 闭源体并行”的混合姿态;可以说“最懂怎么把开源做成流量入口”的非 Google 即 Meta。
中立点评:优势 —— 授权相对宽松、社区/推理栈(llama.cpp/Ollama 对它支持最早最全),是本地党的天然默认;局限/争议 —— 许可条款逐版收紧(商用与月活门槛版本互拼),早期“开放≠可随意商用/署名”的边界反复被社区拉锯;中文能力往往不如 Qwen/GLM 这类以中文原生训练。
现役(2026-09 视角):本地主力走 Llama 系列各尺寸量化;渠道:llama.com / Ollama「llama*」;需留意每代实际许可。
●xAI(Grok · 背靠 X 生态起步)+
来龙:马斯克 2023 年创立 xAI,主力产品 Grok 一出生就与 X(原 Twitter)账号生态深度绑定、边训练边借社交数据与流量起量;主张是“探索宇宙本质”,落地却更常以“少设限的风格 + 大数据量 + 竞技算力”的旗帜出现。
关键节点:Grok 初代以“毒舌/快速接入 X”刷脸,后续转入正经大模型军备(含推理与多模态主线),也曾在公开报道里因“嘴替式输出翻车 + 并入某 $200M 军事合同”双双占据头条 —— 两头都是它的舆论画像。到 2026 仍是商业闭源为主要基调,本地少有官方权重。
中立点评:优势 —— 有 X 生态数据/分发与算力大投入,风格差异化还接地气;局限 —— 成熟度与多模态/长文档仍不如头部,且“口无遮拦”在商用合规上既是卖点也是雷,本地基本不可自托管是它和很多企业客户的硬约束。
现役(2026-09 视角):以 X / API 内使用为主;暂无官方开源本地权重是常态,部署前请按官方页判断。渠道:x.ai
●Mistral AI(法国 · 欧洲开源旗手)+
来龙:2023 年成立于巴黎,创始团队多人出身 Google DeepMind 与 Meta,是“欧洲要自己做大模型主权”这一诉求的代言人:既发可研究的社区权重,也做商用云 API(数据中心在欧盟合规利好),双轨并行很典型。
关键节点:从一颗 7B 起家、到 Mistral 7B/8x7B 与 Mixtral MoE 高分上榜/惊艳“小模型也能 MoE”,再到深度使用本地化的小型与中型开源档;编程向 Codestral、助手 Le Chat 也都贴开发人群。它是比 Meta 更“极客亲开源”的非美国代表之一。
中立点评:优势 —— 开源与许可相对干净、欧美数据中心合规、受本地与法务都买账;局限 —— 体量/生态仍无法与美系头部拼旗舰,中文、工具链与多模态覆盖也不如主战场全。
现役(2026-09 视角):开源文档看 mistral.ai/blog 与见 Ollama「mistral」;云走 Le Chat API,托管地偏欧。部署难度:7B 起步,单卡友好。
●Microsoft(Phi·小而强 双轨:既卖 OpenAI 也自研开权重)+
来龙:微软用“投 OpenAI + 把 AI 铺进 Azure/Office 全家桶”占据全栈身位,同时又在边缘端另起灶做 Phi 族“小模型”(给落不了大卡的场景当甜点),是“巨人里最贴开源小模型的稀有者”。
关键节点:实际落点集中在 Phi-3 / Phi-4 系列(2024–) 以小参数量在低算力本地甚至 NPU/CPU 上可用,主打“够用、快、省”;背后仍是与 OpenAI 的独家合作与自研两手抓,既保障云旗舰也守住 edge。
中立点评:优势 —— 双生态弹药与分发、小模型工程功底明显;局限 —— Phi 偏“字面质量实验”,复杂推理/长文档/中文相对 Qwen/Gemma 有差距,语言与许可也要各自核对;它并不会把“主干旗舰”开源。
现役(2026-09 视角):本地部署走 Phi 体积档 + Azure 收费旗舰,互不矛盾;渠道:azure.microsoft.com / huggingface 微软官仓 / Ollama「phi」。自研旗舰尺度小于别家是常态,匹配时看需求上限。
国产篇(同模板代表 · 主开源者先到,其余随后补齐)
●DeepSeek(深度求索 · 高效开源 + 聪明省钱派)+
来龙:源于背靠量化交易资金的深度求索,被业界当作“开源里的性价比/效率党”:先以 V/R 系列把“分算力/酷炫成本拿高分”演成主流打法,2025 年初 R1 的开放式推理 + V3 的 MoE 架构让“国产也开权重、还能打榜”刷屏。
关键节点:DeepSeek-R1(2025 开源推理线)与 V3(2024末 MoE 671B-A37B)→ V3.1 系“思考/直答混合”→ 到 2026-09 的 V4 预览(如 V4-Flash:MoE、总参 284B / 激活 13B、面向 1M token 上下文),继续证明“稀疏激活 × 长上下文”能把大容量做进高效的本地/边缘化部署。
中立点评:优势 —— MIT(大部分权重)式的开源自由度 + 中文通用/长文/推理口碑 + 把研究产物大方放出的姿态得到开发者认可;局限 —— 训练/首发资源紧张、国际合规与个别模态积累不深,部分“爆款波次”服务偶有排队,商用前请以官方文档口径复核许可以及稳定性。
现役(2026-09 视角):R1/V3-* 系列各档量化可单机/工作站直跑;V4 系预览如需跑,优先看官方权重与量化副本(本地需较大内存/显存)。渠道:deepseek.com / github.com/deepseek-ai / HF 官方 repo(注意版本日戳)。
●阿里 · 通义(Qwen · 中文开源“全尺寸之王”)+
来龙:出自阿里云研究线,Qwen 家族以“从小到大几乎每个档位都给开源权重 + 多语言 + 原生中文强”刷出极高使用率,是本地党在华语区最常见到的默认选项之一。
关键节点:从 Qwen(1.5/2.5,0.x~72B 全覆盖) → Qwen-Coder(编码专用多尺寸)→ Qwen3(0.6B–235B、含 MoE,加入 thinking 档与工具)→ 2026 继续到 Qwen3.5/3.8(3.8-27B 等 + 更小/多模态与“flash‑next”前瞻档);节奏之密基本是当季“部署量最快上新”的开源线之一。
中立点评:优势 —— 档位全、许可宽敞(多为 Apache-2.0 或其官方宽松条款)、工具调用与中文 Agent 生态成熟,兼容栈最广(Ollama/LMC 老熟脸);局限 —— 数据/审查按境内交付策略处理(部分海外/要实权部署场景要先核),旗舰往往闭源“更强”版本不完全开放,自部署需要在能力与许可间自己核对。
现役(2026-09 视角):本地优先看 Qwen 官方各尺寸量化(1–27B 适合主流居家/工作站,36B+MoE 给更大机器);渠道:qwenlm.github.io / github.com/QwenLM / Ollama「qwen*」;许可与审查口径以其发布公告为准。
●智谱 Z.ai / GLM(中文原生态 · 开源核心 + 商业加强)+
来龙:脱胎清华系研究积累(智谱/GLM 一路有学术长期线),主打“以中文与代码 Agent 见长的自然形态”。一路从 ChatGLM → GLM 系,2025 年后开始按“开源核心 + 更强的商用版”双轨发行。
关键节点:GLM-4.x 时代已有中文 Agent/多模态布局,到 2026 的 GLM-5.3 家族(含 GLM-5.3-Flash:总约 320B / 激活约 18B 的多模态、1M token 上下文、已开源权重)进一步把“长程代码/工具 Agent + 视觉进编码环”做成卖点;许可给到社区(权重或 MIT 见其仓)让它成为本地可尝试的新面孔。
中立点评:优势 —— 中文原生强、Agent 与工具调用被开发群口碑、Flash 档以“激活小、吞吐高”贴近个人工作站;局限 —— 部分最强档做“商用闭源或授权制”、长尾生态与国际插件仍比不过 Qwen/Llama,落地同样需看清许可与审查条款。
现役(2026-09 视角):本地可在官方 repo/HF「zai-org/GLM-*」拿到新权重,小档也能借量化在中等配置上试;渠道:z.ai / github.com/zai-org / huggingface。
RAG:给你的本地模型插上「自家文库」
▸ 实战进阶 · 把私有资料喂给本地 AI模型再强也被训练期「钉死」在旧知识里。RAG(检索增强生成)让你不用重训, 就把论文、公司 wiki、个人笔记、代码仓库变成它的「外接书架」——提问时先检索相关章节,再把答案缝进上下文。
一个 RAG 的完整流水线 CORE
文档库(温文/Notion/PDF/代码)
│ ① 加载 + 解析
▼
切块(chunk) ── ② 分块策略(重叠/按结构)
│
▼
Embedding 向量化(本地小模型如 bge-m3) ── ③ 存进向量库(Chroma/FAISS/…)
│
▼ 新的提问
【查询】:把问题也向量化 → top-k 相似度检索 → (可选)重排 rerank
│
▼
组装 Prompt(json 置顶检索片段 + 原问题) ── ④ 连同上下文交给推理引擎
│
▼
输出带引用的回答
bge-m3 / nomic-embed / all-MiniLM——中文优先 bge 系;台词:与 llama.cpp / Ollama / vLLM 的 OpenAI 兼容端点对接即可(见 §05)。
一段能跑的最小 RAG(Python) PRO
import chromadb, sentence_transformers as st # 本地 embedding(无需调用云端) embed = st.SentenceTransformer("BAAI/bge-m3") docs = ["把论文/笔记/帮规逐条贴这里,例如:", "显存估算 ≈ 参数量B × 每权重字节 + KV 缓冲。", "第二条真实资料……"] ids = [f"id-{i}" for i in range(len(docs))] emb = embed.encode(docs).tolist() # 手动算好向量 db = chromadb.Client() col = db.create_collection("notes") col.add(ids=ids, documents=docs, embeddings=emb) # 检索:把问题也向量化 q_emb = embed.encode(["本地部署要多大显存才够 Qwen3-8B ?"]).tolist() "#(若下面的两行复制后多出反斜杠,等价正确写法是:" "hit = col.query(query_embeddings=q_emb, n_results=2)['documents'][0] 然后自己 print)" hit = col.query(query_embeddings=q_emb, n_results=2)[\"documents\"][0] print(">> 命中片段:\\n", \"\\n---\\n\".join(hit)[:200]) # 拼进系统提示,交给本地 LLM(Ollama)就行(见 §05 的 OpenAI 兼容端点)
LoRA 微调:给开源模型补上「你的领域心智」
▸ 实战进阶 · 想真香要整RAG 管「查到」,微调管「学会你的语气 / 领域约定 / 私有 schema」。 全量重训几百万成本?不必——LoRA 只学一组极小的「差量适配器」,就能在 1 张显卡上让模型“私化”。
LoRA 到底是什么 CORE
unsloth / peft 很方便)。一串“最小可联想”的超小脚本(QLoRA · PEFT) PRO
# 数据先行:准备 JSONL,每行 { instruction, input?, output }(几十到几千条即可起步) # {"instruction":"按公司格式拟一封回信","input":"客户催货","output":"尊敬的客户…"} from datasets import load_dataset data = load_dataset("json", data_files="my_train.jsonl")["train"] # 在 4bit 基座上做 QLoRA from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig import peft, torch bnb = BitsAndBytesConfig(load_in_4bit=True, bnb_4bit_quant_type="nf4", bnb_4bit_compute_dtype=torch.bfloat16) base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-7B-Instruct", quantization_config=bnb, device_map="auto") # 挂 LoRA:rank 8~16 通常起步就够(kbit 训练前记得先 prepare_model_for_kbit_training) model = peft.get_peft_model(base, peft.LoraConfig( r=16, lora_alpha=32, target_modules=["q_proj","k_proj","v_proj","o_proj"], lora_dropout=0.05)) # 训练循环略(用 transformers.Trainer 配 data_collator);3 epochs 即可过度拟合,盯验证不掉即可停。 # 训练完合并导出:model.save_pretrained("adapter")→ 用 merge 回原权重 → GGUF 量化 → ollama 直跑(见 §05)
③ 兼容 Ollama 的做法是
pip install unsloth / 使用 llama.cpp 的 gguf-merge 做 量化导出,本地直跑无痛回滚。2026 折腾主场:近一年多社区最想上手的那批模型
▸ 视角 2026-09 · 真命令 · 显存分层不再只报名字。每一款都写清:为什么值得折腾 → 本地到底怎么跑(含大模型的民间攻坚法)→ 一条能复制的命令 → 坑在哪。 分级:甜品卡可跑 / 工作站优选 / 民间攻坚·大内存。
极客词表:一句秒懂 · 随查随走
▸ 字典 · 读到哪儿忘到哪儿就回这页全书黑话在这里一次性对表。遇到陌生缩写,翻回来瞄一眼即可。
- Token
- 文本最小编码单元;中文约 0.7~1.5 字/个。一切长度的底层货币。
- 上下文 / Context
- 模型一次能同时“放在心上”的 token 数上限(含 prompt + 已生成)。
- 参数 Parameter
- 可学习权重数;7B≈70 亿。显存按它 × 每权重字节算。
- 激活参 / Active
- MoE 里每 token 真正用到的参数;决定这种“总大激活小”模型推理多轻。
- Logits
- 输出前一层未经归一化的得分,越大越像被选中。
- 采样 Sampling
- 在概率分布里按规则挑下一个 token 的策略集合。
- temperature
- 缩放 logits 的“温差”;<1 更稳、>1 更随性(会暴走)。
- top_p(核采样)
- 只看累计概率约覆盖 p 的候选子集再抽,去尾保质量。
- top_k
- 只从前 k 个最可能 token 里抽,更“强硬”地砍尾巴。
- min_p
- 低于最优候选某个比例的 token 直接扔,防碎词。
- repeat 惩罚
- 对已输出的内容小额罚分,压制复读/车轱辘话。
- KV-Cache
- 每层保存的历史 K/V 注意力缓存;随上下文线性吃显存。
- Flash-Attention
- IO 优化的注意力实现,长上下文省显存还提速。
- 量化 Quant
- 把 FP16 权重对齐到更低位(Q4/Q8…),以极小幅精度损失换体积+速度。
- GGUF
- llama.cpp 系单文件模型格式(内含量化 schema 与模板),本地党的“.dmg”。
- MoE
- 稀疏专家混合:总参大、每 token 只唤 top-k 专家,吃存储省算力。
- Router / Top-k
- MoE 里决定“这个 token 交给哪几个专家”的小路由器。
- RoPE
- 旋转位置编码,给自注意力注入顺序感;长文常靠它外推/插值。
- Embedding / 向量化
- 把文本映射成向量以度量语义相近程度;检索的根基。
- RAG(检索增强生成)
- 先检索私有资料再交给模型生成,比硬塞 128k 又省又准。
- 向量库 VectorDB
- 给 embedding 向量做相似检索的高效存储(Chroma/FAISS/pgvector)。
- LoRA / QLoRA
- 微调时只学极小的低秩差量;QLoRA=再叠 4bit 压缩,让个人卡也能调大模型。
- 全参/微调 vs PEFT
- 前者改全部权重、吃显存多;后者只改 LoRA 那点参数,快且可随时卸载。
- Chat Template
- 用什么分隔符把 system/user/assistant 拼成模型要的输入形态;Jinja 模板。
- Guided Decoding
- 逐步只让模型吐符合语法/JSON-schema 的 token,结构零非法率。
- Tools / Function Call
- 模型“决定”调用你声明的工具并填参,由你执行——Agent 的握手。
- FIM 补全
- Fill-in-the-Middle:给前文+后文补中间;IDE 自动补全的底层。
- Prefill / Decode
- 读取整个 prompt(并行快)→ 逐 token 自回归(慢)两阶段,TTFT/tps 由此来。
- 语境后处理器
- CUDA(N)/ROCm(A卡)/MPS(Apple) 分别为各家 “能用这模型的开关”。
- Ollama / llama.cpp / vLLM
- 三大本地运行架子:极简|底层GGUF|高吞吐服务化,见 §05。