DATA CUT 2026-07-27 116 活跃模型 680 A 类案例

CASE EVIDENCE / A RECORD

phiraml 使用 GPT-5.5 (xhigh) 处理软件工程任务执行

phiraml 公开的代码代理与软件工程案例,来源为 公开代码库,复核于 2026-06-27T09:14:00Z。

原始记录:claude-codex-judge 用 GPT-5.5 xhigh 作为只读判断代理

A

Chinese Brief

中文案例导读

phiraml 公开的代码代理与软件工程案例,来源为 公开代码库,复核于 2026-06-27T09:14:00Z。 Model Atlas 将它标记为 A 类证据,因为它同时具备具体使用者、具体任务、公开原始证据和可访问产物。 Model Atlas 不把 benchmark、教程、发布说明或集合页包装成真实案例。

厂商OpenAI
模型GPT-5.5 (xhigh)
任务类型代码代理与软件工程
审核状态auto_approved

任务

真实任务背景

claude-codex-judge 是 Claude Code skill,README 明确说明它使用 OpenAI codex CLI 的 gpt-5.5、xhigh reasoning,作为独立只读 judging agent 审查 Claude 的 plans、designs、diffs 和 decisions。

代码代理与软件工程公开代码库A 类可核验real_case
公开产物

公开仓库包含 .claude/skills/codex-judge/SKILL.md、codex-judge.sh wrapper 和使用示例;输出 verdict、关键修复建议,并支持跨轮 session continuity。

模型作用

GPT-5.5 (xhigh) 负责读取代码库上下文并提出反驳、风险和判断结论,为 Claude 的计划或 diff 提供第二模型审查。

风险边界

证据来自项目 README 和公开脚本;案例是开源工具而非客户生产故事。