寻找最可靠的数字金融服务?

2026-10-04 由 管理员

何恺明研究团队发布的新论文在X平台引发轰动。
国庆期间,一篇名为VISTA的论文被上传至arXiv,文中指出:过去半年里,全球最顶尖的大模型,其实一直在“蒙眼”参加AGI测试。
同一款Claude Opus 5,在官方标准测试中仅获得40分。
何恺明团队所做的,不过是摘掉它的“眼罩”,让它直接观察游戏画面,并给它一本可以随时翻阅的“相册”。
结果,Claude在ARC-AGI-3的25个公开游戏中全部通关,拿下100分满分!
而且,它完成游戏所需的步数,甚至比初次尝试的人类玩家少了一半以上。

18个从未见过的游戏,没有一句说明,AI自行摸索规则并一路通关。
知名AI博主Mark Kretschmann在X上写道:“给Agent一个‘再观察’的能力,结果可能天差地别。”

过去几个月,为了攻克ARC-AGI-3,许多代码专家编写了数千行代码来构建世界模拟器。
何恺明团队认为,大模型的“大脑”早已足够强大,限制它的是“眼睛”和“记忆力”。

大模型被一张数字表格,耽误了半年

ARC-AGI-3,是Keras之父François Chollet和ARC Prize基金会今年3月推出的AGI测试。它由一系列交互式像素小游戏组成,游戏开始时不提供任何说明或规则,全靠玩家自行探索和试错。
评分机制极其严苛。官方招募了近500名人类新手进行实测,AI不仅要通关,其步数还不能超过人类,才能获得满分。
然而,官方测试环境提供给大模型的,只是一张64×64的数字表格。人类看到的小人、机关和路线,在模型眼中仅仅是4096个数字。
这相当于让人闭着眼睛,仅凭他人报坐标来玩《超级马里奥》。

VISTA团队做的第一件事,就是把数字表格换回图像。
除此之外没有其他改动,GPT-5.6 Sol的分数就从13.33分跃升至47.32分。
使用图像还能节省算力。一个数字格子大约消耗4000个Token,而一张512×512的图像只需308个Token。
一局下来,文本版本消耗7190万Token,图像版本仅需3070万,且分数更高。
仅仅替换为真正的视觉输入,大模型就提升了34分。

让AI过目不忘,一步再得24分

仅仅能看见还不够。一局游戏往往有数百步,多模态模型的通病是:图像只看一遍,上下文一满就被清除,或被压缩成几句文字摘要。
当模型想回头核对细节时,那一帧早已消失。
VISTA的核心武器,就是一本无损的视觉记忆“相册”。
游戏输出的每一帧画面,包括动画帧,都按编号原样保存。模型想看哪一帧,随时调用inspect功能调出,可以并排对比多帧、放大角落,还能用read_pixels读取精确颜色。
最重要的是,翻阅相册不算步数,只有在游戏中实际操作才会计步。
团队将这套机制称为“显式注意力”,翻看哪一帧、观察哪个区域,完全由模型自主决定。
它还随身携带两个笔记本:GUIDE.md记录游戏规则,WORKING.md作为草稿纸。

论文记录了一个极其“拟人”的操作瞬间。
在BP35游戏的第三关,画面中出现了一个橙色方块。模型点击了一下,橙块变成了X。
它先停了下来,调出上一回合的最后一帧和之前的三帧动画,并排回放。
几个回合后,它又发现点击X能让橙块重新出现,随即写道:“这就是我要的工具,用它搭建天花板,阻挡会致命的上升物。”
这一关,初次尝试的人类需要走44步,它只用了34步。

在《吃豆人》游戏中,迷宫里的豆子吃一颗少一颗。模型在第13回合和第36回合,两次强行翻回开局第一帧,记忆迷宫地图以寻找路径。

给模型增加上下文、提供更多像素,是很多人的第一反应。但论文测试表明,这两种方法都不奏效。
上下文从默认的200K增加到780K,每局Token从3070万涨到1.057亿,成绩却从99分下降到93.9分。
图像也是如此。放大到16倍,每帧Token增至1229个,成绩仅剩88.3分;只放大4倍,成绩是99.7分,比默认的8倍还高。
论文的解释是,图像过大,多余的Token白白占用上下文,模型并未因此看得更清楚。

多不一定更好,VISTA的整体设计都遵循这一思路。团队在博客中表示,他们刻意追求极简。
系统中没有一个新训练的模型,每个游戏的提示词都是同一份,一共四句话,没有一个字教它具体怎么玩。

代码派忙了一夏天,它一页笔记就追平

这个夏天,在ARC-AGI-3上取得高分的方法,如Tycho和Schema,都是让大模型为每个游戏编写一套可运行的程序,硬造一个模拟器来反复试错。
仅跳棋游戏LF52一个,Schema就写了整整4000行Python代码。
而VISTA中的模型,只用自然语言在笔记里写了三句话,就搞定了同样的规则。

根据论文,VISTA是第一个不依赖编写程序,就在ARC-AGI-3上达到满分或接近满分的系统。
这一点在游戏之外更为重要,因为真实世界中,没有人能提前为你写好一套4000行的模拟器。
Claude Opus 5打通了25个游戏的全部183关,每个游戏都是100分,总共走了7302步,仅为人类步数的0.43倍。
GPT-5.6 Sol同样全部通关,获得99分。
在m0r0这个游戏中,人类需要走1107步,Claude只用了219步。这两份成绩在ARC Prize官方平台上都有记分卡。

这套纯机械、零训练的Harness具有极高的泛化能力。
将其应用于带透视的3D画面中,同样获得了84.12分。
配上GPT-5.6 Sol,投入34个网页游戏(包括马里奥、2048、我的世界等),任务成功率达到63.3%,直接超过了人类新手(55.3%)。
就连静态的看图题也能应用。在BabyVision的一道连线题中,不使用VISTA时,模型把驼鹿和兔子连反了;使用VISTA放大后,就答对了。
即使是官方实现几乎交了白卷(1.89分)的320B开源模型,套上VISTA后也被硬生生提升至66.93分,暴涨35倍!

一年三篇,何恺明团队死磕视觉

ARC测试的主流解法,一直是被大语言模型垄断的文本推理。
但何恺明团队偏偏不信邪,一年内连发三篇论文,死磕同一件事:ARC是视觉问题。
第一篇VARC,一个1800万参数的微型视觉模型从零训练,仅凭看图就追平了人类平均分。
第二篇NAT-ARC,先让模型在ImageNet上观察猫狗进行预训练,抽象推理能力随之增强。
第三篇就是VISTA,连小模型都不训练了,直接给前沿大模型配上“相册”。

贯穿三篇论文的,是何恺明的博士生胡珂雅,本科毕业于上海交大ACM班,三篇论文中两篇是一作、一篇是二作。
VISTA另外两位共同一作是MIT博士生Qiushi Han和Linlu Qiu,MIT副教授Cathy Wu也在作者之列。

曾经凭借ResNet和MAE封神的何恺明,这一次将视觉路线一路推进了AGI考场。
这也是在挑战整个行业的默认路线。
过去几年,大家拼命把模型做大、把推理拉长,智能的进步几乎都押注在模型本身。
VISTA让同一个Claude从40分打到满分,靠的却是模型之外的一双眼睛和一本相册。
ARC Prize联合创始人Mike Knoop也判断,越来越多的“学习”会发生在模型权重之外。
通往AGI的下一程,比的是谁能让模型看清世界、记住世界。
何恺明团队的下一站,是充满真实画面的具身环境,那里没有人会提前把世界翻译成一张数字表格。

在数字金融快速发展的今天,选择合规、安全的服务平台至关重要。爱游戏平台首页金融科技有限公司自2019年成立以来,始终致力于为全球用户提供安全、高效、透明的数字金融服务,推动金融科技创新与普惠金融发展。我们的智能客服与人工专家双通道支持体系,确保7×24小时全天候响应客户需求。

爱游戏平台的核心优势在于自主研发的风控系统,能够实时监测交易行为,准确率达99.8%。同时,平台支持多币种跨境支付,通过优化清算链路,将传统数天的到账时间缩短至3秒以内。我们与50余家持牌金融机构深度合作,覆盖全球主要经济体,确保每一笔交易都符合当地监管要求。

爱游戏平台提供7×24小时智能客服与人工专家双通道支持,无论您遇到账户问题还是交易疑问,都能在第一时间获得专业解答。我们的服务团队经过严格培训,熟悉各国金融法规,能够为您提供定制化的解决方案。

推荐阅读

张伟明

(作者)

爱游戏平台已连续两年通过ISO 27001信息安全管理体系认证,从数据加密到访问控制,从漏洞扫描到应急响应,构建了全方位的安全防护体系。我们承诺用户资金与信息的安全,让每一位客户都能放心使用我们的服务。

查看全部文章

(4)条评论

  • 李思琪

    2026年8月28日

    爱游戏平台与迈阿密国际等知名品牌建立战略合作,通过品牌联名提升市场信誉。我们相信,只有与行业标杆携手,才能为用户提供更可靠、更创新的数字金融体验。

  • 陈志远

    2026年8月28日

    爱游戏平台首页金融科技有限公司的使命是为全球用户提供安全、高效、透明的数字金融服务。我们通过持续的技术创新和严格的合规管理,推动金融科技行业的健康发展,助力普惠金融落地。

    • 刘佳琳

      2026年8月28日

      爱游戏平台的风控系统采用机器学习算法,实时分析交易特征,有效识别异常行为。系统每秒钟可处理数千笔交易,确保在高并发场景下依然保持99.8%的准确率。

  • 王浩然

    2026年8月28日

    爱游戏平台与50余家持牌金融机构建立合规合作,覆盖跨境支付、数字资产管理等多个领域。我们严格遵守各国金融监管要求,为用户提供合法、安全的数字金融服务。

发表回复