Nvidia AVO 在 ARC-AGI-3 交互式推理基准测试中获得 100% 的成绩。
Nvidia AVO scores 100% on the ARC-AGI-3 interactive reasoning benchmark

原始链接: https://twitter.com/NVIDIAAI/status/2090786258981466231

NVIDIA AVO 通过使用记忆、工具和执行反馈,持续进行检查、规划、实施和评估,并在此过程中不断积累经验。这使得系统能够在长时间运行的任务中持续推进,而无需在每次模型重置上下文时重新开始。阅读更多

Nvidia 宣布其全新的“代理变异算子”(AVO)框架在 ARC-AGI-3 推理基准测试的公开集上取得了 100% 的满分成绩。Nvidia 声称,通过将 AVO 与 Claude Opus 5 和 GPT-5.6 Sol 等前沿模型结合,该系统能够通过更少的环境操作来完成任务,从而提升性能。 然而,Hacker News 上的讨论对这些结果提出了多点质疑: * **基准范围:** 批评者指出,100% 的得分仅适用于公开测试集,而非更严格的半私有或私有测试集。 * **方法论担忧:** 评论者质疑使用外部“框架”(而非模型本身的原始推理能力)是否违背了基准测试的初衷,并认为此类系统在拥有充足外部辅助的情况下,早已具备执行复杂任务的能力。 * **透明度:** 用户指出,目前缺乏关于总执行时间(“挂钟时间”)的数据,暗示如果系统需要很长时间来思考,那么所谓的效率提升可能被夸大了。 虽然 Nvidia 将此视为自主进化搜索领域的一个里程碑,但对于这究竟代表了真正的通用人工智能(AGI),还是仅仅是先进的提示词工程与基于框架的优化,社区仍存分歧。
相关文章

原文

NVIDIA AVO continuously inspects, plans, implements, and evaluates, using memory, tools, and execution feedback to build on what it learns along the way. This allows the system to sustain progress across long-running tasks rather than starting over with each model context. Read

联系我们 contact @ memedata.com