Rubber Duck功能缩小Claude Sonnet与Opus性能差距74.7%

IT之家 4 月 8 日消息,微软 GitHub 官方于 4 月 6 日发布博文,宣布为其 Copilot CLI 推出实验性功能 Rubber Duck,引入跨模型家族的“第二意见”审查机制,让 AI 性能提升接近 75%。

IT之家援引博文介绍,在代码规划阶段,当前编程智能体的早期决策错误容易层层累积,而单一模型的自我审查会受限于自身的训练偏差与盲点。而 Rubber Duck 功能就是引入异构模型作为独立审查者,提供差异化视角以挖掘潜在错误。

该功能采用跨家族模型组合策略,用户选择 Claude 系列模型作为主控后,Rubber Duck 将调用 GPT-5.4 进行审查。其核心任务是检查智能体工作,输出高价值关注点清单,包括被遗漏的细节、值得质疑的假设及边缘案例。

博文进一步通过 SWE-Bench Pro 基准测试评估,基于 Claude Sonnet 4.6 和 Opus 4.6 单独运行的性能差距对比,发现 Sonnet 4.6 搭配 Rubber Duck 后,成功弥补 74.7% 的性能差距。

在涉及 3 个以上文件或超过 70 步的困难任务中,得分比基线高出 3.8%。实际案例显示,它能有效挖掘架构逻辑漏洞、循环覆盖错误及跨文件冲突等深层问题。

Rubber Duck 支持主动、被动及用户触发三种模式。系统会在制定计划后、复杂实现后及测试编写后三个关键检查点自动寻求审查,也可在陷入循环时被动触发。该功能为确保过程透明,用户也可随时请求审查,Copilot 将展示反馈内容与修改依据。

目前该功能已在实验模式下线。用户安装 GitHub Copilot CLI 并运行 /experimental 命令即可启用。启用后,选择 Claude 模型并开通 GPT-5.4 访问权限即可体验。

暂无介绍....

延伸阅读:

OpenAI下调高端服务门槛,推出100美元Pro订阅、直指Anthropic

在生成式AI竞争持续升温之际,OpenAI于美东时间9日周四宣布,推出全新的100美元/月ChatGPT Pro订阅方案...

娱乐早知道
2026年4月10日
AI换脸偷声侵权,那么大模型训练呢?

近期,配音行业掀起了一场大规模抵制AI声音侵权行动,原因是如今AI仿声、声音克隆等技术滥用愈演愈烈。无独有偶,从撞脸明星...

娱乐早知道
2026年4月10日
海特高新:成功研制并交付国内首台eVTOL模拟器及相关仿真解决方案

有投资者向海特高新(002023.SZ)提问,请问公司管理层,公司在低空飞行模拟器这一块,目前主要方向是在人为主,还是工...

八卦小灵通
2026年4月10日
早期项目 | 字节、OPPO、一加三重背景产品人,将软硬一体写入底层,要让AI看懂世界

作者丨欧雪编辑丨袁斯来过去两年,主流AI交互依赖于输入框——用户先组织语言提问,AI再给出答案。这种“对话式”交互效率极...

娱乐大事件
2026年4月10日
合十思维赵普:中德机器人合作不是零和博弈,而是双向赋能优势互补

来源:环球网【环球网财经 记者 陈超】“德国并不缺人工智能,也不缺机器人。技术并不是德国的短板。”近日,在由德国北威州国...

娱乐早知道
2026年4月10日