DATA CUT 2026-07-27 116 活跃模型 680 A 类案例

CASE EVIDENCE / A RECORD

turboderp / ExLlama project 使用 Llama 65B 处理软件工程任务执行

turboderp / ExLlama project 公开的代码代理与软件工程案例,来源为 公开代码库,复核于 2026-06-27T08:32:44Z。

原始记录:ExLlama 为量化 LLaMA 65B 提供双 GPU 本地推理运行时

A

Chinese Brief

中文案例导读

turboderp / ExLlama project 公开的代码代理与软件工程案例,来源为 公开代码库,复核于 2026-06-27T08:32:44Z。 Model Atlas 将它标记为 A 类证据,因为它同时具备具体使用者、具体任务、公开原始证据和可访问产物。 Model Atlas 不把 benchmark、教程、发布说明或集合页包装成真实案例。

厂商Meta / Llama
模型Llama 65B
任务类型代码代理与软件工程
审核状态auto_approved

任务

真实任务背景

ExLlama 项目构建了面向量化 LLaMA 模型的本地 GPU 推理运行时,并在 README 中列出 Llama 65B 的双 GPU运行配置和吞吐结果,用于在 4090 + 3090 Ti 等消费/工作站 GPU 上运行 65B 模型。

代码代理与软件工程公开代码库A 类可核验real_case
公开产物

公开 repo 给出可运行代码、配置和 Llama 65B 双 GPU结果表,显示 2,048 token 上下文、约 39.8GB/43.4GB VRAM 配置以及约 16-20 token/s 的生成速度。

模型作用

LLaMA 65B 是该运行时验证和支持的目标大模型之一;ExLlama 的价值在于把 65B 底座通过 GPTQ/量化权重部署到本地多 GPU推理场景。

风险边界

该案例是开源运行时/部署产物,不是终端业务应用;README 同时包含性能表,但 repo 本身是可访问可运行 artifact,不是单纯 leaderboard。