DATA CUT 2026-07-27 116 活跃模型 680 A 类案例

CASE EVIDENCE / A RECORD

Prateek Rungta / prateek 使用 GPT-5.2 (xhigh) 处理软件工程任务执行

Prateek Rungta / prateek 公开的代码代理与软件工程案例,来源为 公开代码库,复核于 2026-06-27T09:22:25Z。

原始记录:Prateek Rungta 用 Ralph + GPT-5.2-xhigh 迭代优化 Anthropic performance take-home 解法

A

Chinese Brief

中文案例导读

Prateek Rungta / prateek 公开的代码代理与软件工程案例,来源为 公开代码库,复核于 2026-06-27T09:22:25Z。 Model Atlas 将它标记为 A 类证据,因为它同时具备具体使用者、具体任务、公开原始证据和可访问产物。 Model Atlas 不把 benchmark、教程、发布说明或集合页包装成真实案例。

厂商OpenAI
模型GPT-5.2 (xhigh)
任务类型代码代理与软件工程
审核状态auto_approved

任务

真实任务背景

公开 PR 描述称这是一次实验:观察 Ralph 搭配 gpt-5.2-xhigh 处理 Anthropic performance take-home 的效果;PR 分支名为 GPT-5.2-xhigh,评论记录了多轮 Ralph iteration、Codex exit、提交和测试结果。

代码代理与软件工程公开代码库A 类可核验real_case
公开产物

公开 PR/分支包含 56 个提交和可访问代码改动;迭代记录显示模型驱动的优化从 baseline 147734 cycles 降到 98583 cycles,随后通过 SIMD/vectorization 降到 12369 cycles,并保留了 PRD、AGENTS.md、进度和实现文件。

模型作用

GPT-5.2 xhigh 通过 Codex/Ralph 循环参与生成 PRD/AGENTS.md、实现 greedy VLIW packer、SIMD/vectorized kernel、运行 submission tests、更新进度并提交代码,是该公开优化实验的核心编码与迭代执行模型。

风险边界

这是个人公开实验 PR,未合并且部分测量日志为本地文件;证据足以绑定模型、使用者、任务和公开代码产物,但不代表生产部署或官方背书。