DATA CUT 2026-07-27 116 活跃模型 680 A 类案例

CASE EVIDENCE / A RECORD

emilykangdev / stower 使用 Qwen3 Max Thinking 处理代码审查和测试生成

emilykangdev / stower 公开的代码审查与测试案例,来源为 公开代码库,复核于 2026-06-27T08:05:28Z。

原始记录:Stower 用 Qwen3 Max Thinking 作为独立 Judge 复核多模型代码审计结论

A

Chinese Brief

中文案例导读

emilykangdev / stower 公开的代码审查与测试案例,来源为 公开代码库,复核于 2026-06-27T08:05:28Z。 Model Atlas 将它标记为 A 类证据,因为它同时具备具体使用者、具体任务、公开原始证据和可访问产物。 Model Atlas 不把 benchmark、教程、发布说明或集合页包装成真实案例。

厂商Qwen / Alibaba
模型Qwen3 Max Thinking
任务类型代码审查与测试
审核状态auto_approved

任务

真实任务背景

Stower 在 ship-with-fusion 门禁中把 Qwen3 Max Thinking 作为第四谱系的独立 judge,对 Kimi、Grok、DeepSeek 等非同源 panel 产生的代码审计发现做二阶段复核,判断哪些问题真实成立、哪些属于噪声或幻觉。

代码审查与测试公开代码库A 类可核验real_case
公开产物

PR 记录显示 Qwen3 Max Thinking judge 在第 1 轮确认 3 个 P2 问题,其中 2 个已修复、1 个转入 TODO;第 2 轮继续验证修复成立,并判定后续 1 个 P1 与 4 个 P2 阻塞项均未通过源代码核验,避免把 hallucinated finding 当成阻塞问题。

模型作用

Qwen3 Max Thinking 的贡献是作为独立推理裁判读取约 124k tokens 的分支上下文、plans、docs、源码和测试结果,交叉核验 panel 发现并输出可执行的 confirmed/noise 判定。

风险边界

证据来自公开 GitHub PR 描述;未看到完整私有运行日志,但 PR 明确列出 judge 模型、任务、轮次和审计结果。