← LeisureLinux 文章索引
LeisureLinux · 微信公众号文章

【转译】11款大模型本地单卡性能横向测评

AI/Agent 阅读原文(微信)↗

{#section ngcontent-ng-c366337013=""}

作者对 11 款主流的本地大语言模型(参数规模在 15B 到 35B 之间)进行了深度横向测评。以下是测试的基准、方法及各模型表现的详细总结:

{#section-1 path-to-node="1"}

1. 测试基准与环境 (Test Setup)

  • 硬件平台:单块消费级显卡 RTX 3090 (24GB VRAM)

  • 软件/量化:使用 LM Studio 下载模型,统一采用 Q4 量化 版本。

  • 核心配置

-   **Temperature (温度)**: 0
  • Top P: 1.0(旨在消除输出随机性,确保公平对比)。

  • System Prompt: 统一简单的系统提示词。

  • 交互方式: 每次测试前开启全新对话(隔离上下文)。

{#section-2 path-to-node="3"}

2. 测试方法与评估维度 (Methodology)

模型在以下 5 个功能类别中接受挑战,并依据逻辑流、格式、事实准确性和生成速度进行评分:

  1. 逻辑推理 (Logical Reasoning):解决包含隐蔽陷阱的逻辑题。

  2. 创意写作 (Creative Writing):根据特定氛围要求撰写短篇故事。

  3. 代码能力 (Coding):从零开始编写一个包含多种功能的 Reaction Time HTML/JS 应用。

  4. 指令遵循 (Instruction Following):在严格的字数和限制词条件下进行写作。

  5. 准确性 (Accuracy):辨别 10 条陈述句的真伪(事实核查)。

{#section-3 path-to-node="7"}

3. 各模型在各项指标的表现列表

以下表格根据视频中各单项测试的排名和最终总排名整理而成:

[排名]{path-to-node="9,0,0,0"} [模型名称]{path-to-node="9,0,1,0"} [逻辑推理表现]{path-to-node="9,0,2,0"} [写作/指令遵循表现]{path-to-node="9,0,3,0"} [编码表现]{path-to-node="9,0,4,0"} [事实准确性]{path-to-node="9,0,5,0"} [备注]{path-to-node="9,0,6,0"}
[1]{path-to-node="9,1,0,0"} [Qwen 3.5 27B]{path-to-node="9,1,1,0"} [第一名(5/5 分)]{path-to-node="9,1,2,0"} [第一名(氛围极佳)]{path-to-node="9,1,3,0"} [第一名(完美运行)]{path-to-node="9,1,4,0"} [第一名(10/10)]{path-to-node="9,1,5,0"} [综合表现最强,既准确又高效。]{path-to-node="9,1,6,0"}
[2]{path-to-node="9,2,0,0"} [Gemma 4 31B]{path-to-node="9,2,1,0"} [中等 (2/5 分)]{path-to-node="9,2,2,0"} [表现稳健]{path-to-node="9,2,3,0"} [第一名(完美运行)]{path-to-node="9,2,4,0"} [第一名(10/10)]{path-to-node="9,2,5,0"} [强力竞争者,但生成速度较慢。]{path-to-node="9,2,6,0"}
[3]{path-to-node="9,3,0,0"} [Qwen 3 32B]{path-to-node="9,3,1,0"} [中等 (2/5 分)]{path-to-node="9,3,2,0"} [指令遵循略欠缺]{path-to-node="9,3,3,0"} [表现较好 (球速较慢)]{path-to-node="9,3,4,0"} [第一名(10/10)]{path-to-node="9,3,5,0"} [传统强项模型,表现稳定。]{path-to-node="9,3,6,0"}
[4]{path-to-node="9,4,0,0"} [GPTOSS 20B]{path-to-node="9,4,1,0"} [中等 (2/5 分)]{path-to-node="9,4,2,0"} [指令遵循第一]{path-to-node="9,4,3,0"} [第一名(完美运行)]{path-to-node="9,4,4,0"} [中等 (9/10)]{path-to-node="9,4,5,0"} [思考型模型中速度最快。]{path-to-node="9,4,6,0"}
[5]{path-to-node="9,5,0,0"} [Mistral Small 3.2]{path-to-node="9,5,1,0"} [中等 (2/5 分)]{path-to-node="9,5,2,0"} [指令遵循一般]{path-to-node="9,5,3,0"} [较好 (缺安全机制)]{path-to-node="9,5,4,0"} [中等 (9/10)]{path-to-node="9,5,5,0"} [平衡性好,推理速度较快。]{path-to-node="9,5,6,0"}
[6]{path-to-node="9,6,0,0"} [Neatron 3 Nano 30B]{path-to-node="9,6,1,0"} [中等 (2/5 分)]{path-to-node="9,6,2,0"} [指令遵循第一]{path-to-node="9,6,3,0"} [有 Bug (视觉异常)]{path-to-node="9,6,4,0"} [中等 (9/10)]{path-to-node="9,6,5,0"} [指令遵循能力突出。]{path-to-node="9,6,6,0"}
[7]{path-to-node="9,7,0,0"} [Ariel 1.6 15B]{path-to-node="9,7,1,0"} [中等 (2/5 分)]{path-to-node="9,7,2,0"} [指令遵循第一]{path-to-node="9,7,3,0"} [失败 (未完成)]{path-to-node="9,7,4,0"} [中等 (9/10)]{path-to-node="9,7,5,0"} [小参数量模型,指令遵循惊喜。]{path-to-node="9,7,6,0"}
[8]{path-to-node="9,8,0,0"} [Qwen 3.5 35B A3B]{path-to-node="9,8,1,0"} [第二名(过度思考)]{path-to-node="9,8,2,0"} [失败 (无响应)]{path-to-node="9,8,3,0"} [失败 (仅加载封面)]{path-to-node="9,8,4,0"} [失败 (无响应)]{path-to-node="9,8,5,0"} [稳定性极差,多次出现超时无输出。]{path-to-node="9,8,6,0"}
[9]{path-to-node="9,9,0,0"} [LFM2 24B]{path-to-node="9,9,1,0"} [倒数第二 (1/5 分)]{path-to-node="9,9,2,0"} [指令遵循一般]{path-to-node="9,9,3,0"} [失败 (点击无反应)]{path-to-node="9,9,4,0"} [中等 (9/10)]{path-to-node="9,9,5,0"} [非思考型模型中速度最快。]{path-to-node="9,9,6,0"}
[10]{path-to-node="9,10,0,0"} [DeepSeek R1 Distill Qwen 32B]{path-to-node="9,10,1,0"} [中等 (2/5 分)]{path-to-node="9,10,2,0"} [创意写作垫底]{path-to-node="9,10,3,0"} [失败 (代码无法运行)]{path-to-node="9,10,4,0"} [中等 (9/10)]{path-to-node="9,10,5,0"} [在此特定测试集表现不佳,陈词滥调多。]{path-to-node="9,10,6,0"}
[11]{path-to-node="9,11,0,0"} [GLM 4.7 Flash]{path-to-node="9,11,1,0"} [垫底 (死循环)]{path-to-node="9,11,2,0"} [指令遵循较差]{path-to-node="9,11,3,0"} [失败 (未完成)]{path-to-node="9,11,4,0"} [中等 (9/10)]{path-to-node="9,11,5,0"} [综合排名最后。]{path-to-node="9,11,6,0"}

4. 关键结论

  • 最佳单显卡模型Qwen 3.5 27B 是目前 24GB 显存环境下表现最均衡且强大的模型。

  • 推理速度

  • 非思考型: LFM2 24B 速度夺冠;MistralQwen 3.5 27B 处于梯队前列。

  • 思考型: GPTOSS 20B 在速度上显著优于其他思考型模型。

  • 指令遵循Neatron 3 NanoAriel 1.6GPTOSS 20B 在严格限制(如精确字数)下表现最完美。

原版视频网址:

http://www.youtuSLtKGhOXamQ

从 Ollama 到 vLLM:本地大模型从"跑起来"到"跑得飞起"的必经之路

单卡巅峰:RTX 5090 本地模型选型策略与 Ollama 推理栈深度实践

破壁者:OpenVINO 2026.1 发布,NPU 正式接管本地 LLM 推理

从对话到进化:Ollama 2026 核心集成的六大 AI 智能体神器

从数据中心到边缘:Google Gemma 4 全系列架构深度解析与部署指南

深度:阿里 Qwen2.5-Coder 开启"算力平权",代码大模型的"地板价"意味着什么?

2028 全球智能危机——当"过剩智能"瓦解现代经济架构

字节跳动开源 UI-TARS-desktop:基于 VLM 的全场景原生桌面 Agent 深度解析

MiniCPM-o 4.5——全双工多模态实时交互的"临界点"已至

家贼难防!我把本地 Shell 权限交给了 Ollama,它居然开始自我进化了?

本文整理自微信公众号 LeisureLinux 的原创内容(Linux / AI / 安全 硬核技术)。

· 阅读原文(微信公众号)

· 关注公众号 LeisureLinux,第一时间获取技术深度内容。

LeisureLinux 公众号二维码(微信扫一扫关注)