{#section ngcontent-ng-c366337013=""}
作者对 11 款主流的本地大语言模型(参数规模在 15B 到 35B 之间)进行了深度横向测评。以下是测试的基准、方法及各模型表现的详细总结:
{#section-1 path-to-node="1"}
1. 测试基准与环境 (Test Setup)
-
硬件平台:单块消费级显卡 RTX 3090 (24GB VRAM)。
-
软件/量化:使用 LM Studio 下载模型,统一采用 Q4 量化 版本。
-
核心配置:
- **Temperature (温度)**: 0
-
Top P: 1.0(旨在消除输出随机性,确保公平对比)。
-
System Prompt: 统一简单的系统提示词。
-
交互方式: 每次测试前开启全新对话(隔离上下文)。
{#section-2 path-to-node="3"}
2. 测试方法与评估维度 (Methodology)
模型在以下 5 个功能类别中接受挑战,并依据逻辑流、格式、事实准确性和生成速度进行评分:
-
逻辑推理 (Logical Reasoning):解决包含隐蔽陷阱的逻辑题。
-
创意写作 (Creative Writing):根据特定氛围要求撰写短篇故事。
-
代码能力 (Coding):从零开始编写一个包含多种功能的 Reaction Time HTML/JS 应用。
-
指令遵循 (Instruction Following):在严格的字数和限制词条件下进行写作。
-
准确性 (Accuracy):辨别 10 条陈述句的真伪(事实核查)。
{#section-3 path-to-node="7"}
3. 各模型在各项指标的表现列表
以下表格根据视频中各单项测试的排名和最终总排名整理而成:
| [排名]{path-to-node="9,0,0,0"} | [模型名称]{path-to-node="9,0,1,0"} | [逻辑推理表现]{path-to-node="9,0,2,0"} | [写作/指令遵循表现]{path-to-node="9,0,3,0"} | [编码表现]{path-to-node="9,0,4,0"} | [事实准确性]{path-to-node="9,0,5,0"} | [备注]{path-to-node="9,0,6,0"} |
|---|---|---|---|---|---|---|
| [1]{path-to-node="9,1,0,0"} | [Qwen 3.5 27B]{path-to-node="9,1,1,0"} | [第一名(5/5 分)]{path-to-node="9,1,2,0"} | [第一名(氛围极佳)]{path-to-node="9,1,3,0"} | [第一名(完美运行)]{path-to-node="9,1,4,0"} | [第一名(10/10)]{path-to-node="9,1,5,0"} | [综合表现最强,既准确又高效。]{path-to-node="9,1,6,0"} |
| [2]{path-to-node="9,2,0,0"} | [Gemma 4 31B]{path-to-node="9,2,1,0"} | [中等 (2/5 分)]{path-to-node="9,2,2,0"} | [表现稳健]{path-to-node="9,2,3,0"} | [第一名(完美运行)]{path-to-node="9,2,4,0"} | [第一名(10/10)]{path-to-node="9,2,5,0"} | [强力竞争者,但生成速度较慢。]{path-to-node="9,2,6,0"} |
| [3]{path-to-node="9,3,0,0"} | [Qwen 3 32B]{path-to-node="9,3,1,0"} | [中等 (2/5 分)]{path-to-node="9,3,2,0"} | [指令遵循略欠缺]{path-to-node="9,3,3,0"} | [表现较好 (球速较慢)]{path-to-node="9,3,4,0"} | [第一名(10/10)]{path-to-node="9,3,5,0"} | [传统强项模型,表现稳定。]{path-to-node="9,3,6,0"} |
| [4]{path-to-node="9,4,0,0"} | [GPTOSS 20B]{path-to-node="9,4,1,0"} | [中等 (2/5 分)]{path-to-node="9,4,2,0"} | [指令遵循第一]{path-to-node="9,4,3,0"} | [第一名(完美运行)]{path-to-node="9,4,4,0"} | [中等 (9/10)]{path-to-node="9,4,5,0"} | [思考型模型中速度最快。]{path-to-node="9,4,6,0"} |
| [5]{path-to-node="9,5,0,0"} | [Mistral Small 3.2]{path-to-node="9,5,1,0"} | [中等 (2/5 分)]{path-to-node="9,5,2,0"} | [指令遵循一般]{path-to-node="9,5,3,0"} | [较好 (缺安全机制)]{path-to-node="9,5,4,0"} | [中等 (9/10)]{path-to-node="9,5,5,0"} | [平衡性好,推理速度较快。]{path-to-node="9,5,6,0"} |
| [6]{path-to-node="9,6,0,0"} | [Neatron 3 Nano 30B]{path-to-node="9,6,1,0"} | [中等 (2/5 分)]{path-to-node="9,6,2,0"} | [指令遵循第一]{path-to-node="9,6,3,0"} | [有 Bug (视觉异常)]{path-to-node="9,6,4,0"} | [中等 (9/10)]{path-to-node="9,6,5,0"} | [指令遵循能力突出。]{path-to-node="9,6,6,0"} |
| [7]{path-to-node="9,7,0,0"} | [Ariel 1.6 15B]{path-to-node="9,7,1,0"} | [中等 (2/5 分)]{path-to-node="9,7,2,0"} | [指令遵循第一]{path-to-node="9,7,3,0"} | [失败 (未完成)]{path-to-node="9,7,4,0"} | [中等 (9/10)]{path-to-node="9,7,5,0"} | [小参数量模型,指令遵循惊喜。]{path-to-node="9,7,6,0"} |
| [8]{path-to-node="9,8,0,0"} | [Qwen 3.5 35B A3B]{path-to-node="9,8,1,0"} | [第二名(过度思考)]{path-to-node="9,8,2,0"} | [失败 (无响应)]{path-to-node="9,8,3,0"} | [失败 (仅加载封面)]{path-to-node="9,8,4,0"} | [失败 (无响应)]{path-to-node="9,8,5,0"} | [稳定性极差,多次出现超时无输出。]{path-to-node="9,8,6,0"} |
| [9]{path-to-node="9,9,0,0"} | [LFM2 24B]{path-to-node="9,9,1,0"} | [倒数第二 (1/5 分)]{path-to-node="9,9,2,0"} | [指令遵循一般]{path-to-node="9,9,3,0"} | [失败 (点击无反应)]{path-to-node="9,9,4,0"} | [中等 (9/10)]{path-to-node="9,9,5,0"} | [非思考型模型中速度最快。]{path-to-node="9,9,6,0"} |
| [10]{path-to-node="9,10,0,0"} | [DeepSeek R1 Distill Qwen 32B]{path-to-node="9,10,1,0"} | [中等 (2/5 分)]{path-to-node="9,10,2,0"} | [创意写作垫底]{path-to-node="9,10,3,0"} | [失败 (代码无法运行)]{path-to-node="9,10,4,0"} | [中等 (9/10)]{path-to-node="9,10,5,0"} | [在此特定测试集表现不佳,陈词滥调多。]{path-to-node="9,10,6,0"} |
| [11]{path-to-node="9,11,0,0"} | [GLM 4.7 Flash]{path-to-node="9,11,1,0"} | [垫底 (死循环)]{path-to-node="9,11,2,0"} | [指令遵循较差]{path-to-node="9,11,3,0"} | [失败 (未完成)]{path-to-node="9,11,4,0"} | [中等 (9/10)]{path-to-node="9,11,5,0"} | [综合排名最后。]{path-to-node="9,11,6,0"} |
4. 关键结论
-
最佳单显卡模型:Qwen 3.5 27B 是目前 24GB 显存环境下表现最均衡且强大的模型。
-
推理速度:
-
非思考型: LFM2 24B 速度夺冠;Mistral 和 Qwen 3.5 27B 处于梯队前列。
-
思考型: GPTOSS 20B 在速度上显著优于其他思考型模型。
-
指令遵循:Neatron 3 Nano、Ariel 1.6 和 GPTOSS 20B 在严格限制(如精确字数)下表现最完美。
原版视频网址:
http://www.youtuSLtKGhOXamQ
从 Ollama 到 vLLM:本地大模型从"跑起来"到"跑得飞起"的必经之路
单卡巅峰:RTX 5090 本地模型选型策略与 Ollama 推理栈深度实践
破壁者:OpenVINO 2026.1 发布,NPU 正式接管本地 LLM 推理
从对话到进化:Ollama 2026 核心集成的六大 AI 智能体神器
从数据中心到边缘:Google Gemma 4 全系列架构深度解析与部署指南
深度:阿里 Qwen2.5-Coder 开启"算力平权",代码大模型的"地板价"意味着什么?
字节跳动开源 UI-TARS-desktop:基于 VLM 的全场景原生桌面 Agent 深度解析