主页 > 国内 >

不能说的秘密

Qwen3.8,登顶英伟达榜单!_我的网站

进击的巨人

A |     智东西(公众号:zhidxcom)     作者 | 程茜     编辑 | 云鹏          智东西7月22日报道,昨日,阿里千问最新发布的Qwen3.8预览版模型在英伟达评估AI进行算子优化的榜单上登顶,排名超过腾讯混元、人类开发者、Cursor。

B |     长久以来,作为一个农业大省,河南一直是全国劳动人口输出大省。但是近几年来,随着一线城市劳动市场改变、工作压力加重,许多年轻人选择回乡。

C | 他们带着一线城市的经验、技能和视野,在家乡寻找重新开始的契机。                   赵朝辉是在2019年回到老家漯河的,后来误打误撞地把他在城里开不下去的书店办得风生水起;而老家在新乡的年轻人乙飞也在2021年回到河南,他曾经是一个工作狂,回乡的孤独和无聊,让他起心动念做自己的文化品牌。         榜单中SOL得分指的是GPU的峰值算力与HBM带宽共同决定的理论性能极限。

D |                    在家乡,他们用自己的行动聚集了更多有相同经验的人,重新找到了安顿身心的载体。模型这一分数越接近1,代表其生成和优化GPU算子能力越接近理论极限,可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进算子。一二线城市的新中产回到家乡做“zhóng产”,他们的选择,看似“退”,实际上是对生活本质的重新审视。                   回小城,做书的生意                    赵朝辉的老家在漯河市阴阳赵镇。

E | 漯河是一个位于河南中部的不起眼的小城,以发展农业经济为主,繁忙的京广铁路列车每日穿城而过,每次只在这里稍作几分钟的停留。         这一榜单中排名第二的是腾讯混元Hyra、排名第四的是人类开发者Amir M. Mir、排名第六的是美国AI创企doubleAI的全自动GPU内核生成智能体系统、排名第十的是AI编程独角兽Cursor,其他项目暂未找到公开打榜记录。

F |                    不过近年来,漯河高铁站的修整和几条高速公路的开通,还是让阴阳赵镇变得热闹起来。

G |          SOL-ExecBench榜单是今年3月,英伟达推出的GPU CUDA Kernel内核优化基准评测套件,面向Blackwell B200架构专门用来评测AI智能体、编译器、自动内核生成工具写出的GPU算子性能。Qwen3.8登顶的FlashInfer-Bench子集,就是专门用于测试和优化大语言模型推理系统中的GPU算子。2023年,在一众农家乐、理发店、小超市和鸡鸭鹅批发店的街铺业态中,突然出现了一家书店。                   那一年,赵朝辉在自己1000多平方米的小院子里开了这家书店。         7月19日,阿里千问大模型团队宣布将很快发布并开源Qwen3.8。院子里两层楼的房子,一层作为仓库,摞满了书;二层则是一个阅读、选书的空间,除了占满一大面墙的书,还摆放了房子里一些原本的老物件。

H |                    书库一角。(图/由被访者提供)                    此前,赵朝辉在北京从事编剧行业,职业发展循序渐进。

I | 直到2019年左右,年迈的父亲身体变差,已经出现偏瘫的症状,他心里有了包袱,不得不放弃工作,结束了北漂。该模型参数2.4T,可能是除了Fable 5外最强大的模型。

J | 昨晚,Qwen3.8-Max-Preview更新,前端(WebDev)表现更好。

K | 回家后,他找到了一份媒体的工作,但不久后暴发的新冠疫情几乎让公司的业务停滞,他一下闲了下来。         一、从124个模型中提取,共235项CUDA内核优化任务          随着AI智能体生成与优化GPU内核的能力持续增强,现有基准评测的一大局限暴露,其只看重相对软件基线的加速比,而非内核执行方案本身贴近硬件最优效率的程度。而在现代数据中心中,未能充分利用硬件的kernel意味着算力与能源的双重浪费。

L |          基于此,英伟达提出了SOL-ExecBench基准套件。                   赵朝辉之前就喜欢画画,在漯河市区有一个小画室,由于他平常就喜欢淘书,买来的书就放在画室里,画室很快书满为患。他试着在小红书上发帖,希望低价处理旧书。“10元一本,自己付运费”——这是他的第一篇小红书内容。这一套件共有235项CUDA内核优化任务,提取自124个商用及前沿人工智能模型,覆盖大语言模型、扩散模型、计算机视觉、音频、视频以及混合架构,目标硬件为英伟达Blackwell系列GPU,涵盖BF16、FP8、NVFP4精度下的前向与反向计算负载。仅一个月,他靠卖书入账了2万多元。         与以往基于软件性能来进行评估标准相比,SOL-ExecBench的评估目标有所不同。                   他开始把淘书当成事业来做。在一些前辈和朋友的介绍下,他慢慢摸进了书圈。其通过“Speed-of-Light(SOL)”界限来评估内核性能,即由GPU的峰值算力与HBM带宽共同决定的理论性能极限。全国各大出版社都会定期处理微瑕图书,有些书因为在运输、储存过程中磕碰、磨损,不适合作为新书销售,还有一些书存放已久、卖不出去,而像赵朝辉这样的淘书人,可以低价大批量买下这类书。

M |                    2021年前后,赵朝辉把画室对面已倒闭的培训机构的空间租下来,改造成环境舒适的书店空间。

N |          英伟达开发的SOLAR工具能够从FLOP数量、字节数、GPU峰值吞吐量以及带宽等方面,分析出这些基于硬件的SOL界限,然后将这些界限与预先定义的评分基准相结合,从而得出SOL评分。

o | 有人会去书店拍照,但买书的却很少,店里一个月的营业额有时候还不到500元。后来,赵朝辉把市区里的书店关掉,撤到了老家的院子。         具体来说,评分为0.5表示与基准值相当,评分为1.0表示达到了硬件上的SOL界限。因此,这个评分不仅反映了相对于基准值的改进程度,还体现了与最大可实现硬件性能相比所剩余的优化空间。                   刚回去的时候,老家的院子已经很破败了,赵朝辉和家人一起动手改造、翻新,把书全都挪了进去。没想到搬回村里,来书店的人反而变多了。借助社交媒体的精准推送,爱书的同好从四面八方到来,现在店里平均每个月的营业额有一两万元。

p |          为保证评分结果的可靠性和可重复性,SOL-ExecBench还包含一个沙盒评估工具。

q |                    他觉得,小地方的文化资源比较匮乏,人们会冲着阅读场景和在地文化的稀缺性来到这里,小地方原本的劣势,竟成了优势。偏居一隅的小书店,寄托在乡村的场景里,反而能吸引人。

r |                    (图/《要久久爱》)                    来书店的读者里面,有村里的老人、带着孩子从市区来的大人、从事教育工作的人、从外地回流河南的年轻人,还有专门坐高铁从全国各地来的同好。此外基于其开发的智能优化算法,可以在相同的评估协议下改进提供的PyTorch参考实现,这种优化算法可以识别出那些试图操纵评估器的行为,即试图绕过评估机制以获得更快的运算结果。         此次Qwen3.8拿下第一的是FlashInfer-Bench子集,专门用于测试和优化大语言模型推理系统中的GPU算子。只要来了书店,就没有人空着手回去。

s |                    现在,赵朝辉的自我定位是一个“职业淘书人”,通过私域做图书供应链。不久前,他刚在河北涿州挑了价值110万元的书,这些书有些留在涿州库房,有的直接发给客户,有的发回漯河库房,再由同事分拣。质量好、有意思的书常用作零售,另一些书则会批发处理。                   这些年,随着电商直播兴起,直播间成了图书最畅销的渠道,赵朝辉的批发客户里有很大部分是电商直播间。

t |          该子集包含26个来源于Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1的问题。而另一大销售渠道是与他合作的设计公司、房地产公司、咖啡店,这类客户对图书的阅读价值要求不高,需要书用于场景摆设。                   不过两三年时间,赵朝辉竟然把书的生意做得风生水起,在这个小镇上发展出有七八个人的团队。                   回流的年轻人,聚在一起                    疫情时期是许多人生活的转折点,回到家乡是其中一种选择。         该子集覆盖的精度格式为BF16与FP8,每个问题提供7-48个动态形状的输入配置,覆盖真实生产场景,典型任务包括融合注意力(Fused Attention)、FP8 MoE和RMSNorm等推理关键算子。在深圳工作的乙飞便是在2021年回到河南,并在省会郑州落脚。

u |                    相比深圳的快节奏和丰富,郑州的慢节奏和传统让刚回到河南的乙飞感到很不适应,“找不到同频的人,也没有什么可以玩的地方和活动”。         根据官方披露,该测试套件中所有提交内容均在真实NVIDIA B200 GPU上隔离执行,GPU时钟锁定在1500 MHz以保证可复现性。他开始在网上搜罗一些适合年轻人的本地平台,但找来找去只找到一个本地公众号,而且偶尔才会举办活动;而社交App上目的过于明确的交友,让他觉得没有意思,“还不如自己玩”。                   于是他开始自己探索城市和周边,比如寻找独立书店以及一些没有人走过的路线,打卡的同时也发发小红书推文,不久后竟然有人顺藤摸瓜找了过来。

v |          二、榜单排名靠前,意味模型具备闭环自我改进潜力          Kernel优化是少数几个可以提供清晰、客观、可量化反馈信号的真实工程任务之一:          反馈明确:运行时间、吞吐量、带宽利用率可以精确测量;     标准客观:距离硬件理论极限还有多远,没有歧义;     迭代自然:每一轮优化都可以作为下一轮的起点。         这意味着模型可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进。         在SOL-ExecBench FlashInfer-Bench子集上表现靠前,就意味着模型在下面几项能力上具有优势:          长程因果推理:优化决策之间存在复杂依赖链,局部改动会影响全局性能,模型需要跨越长上下文进行一致性推理。乙飞很快就接触到了一大群从北上广深杭等城市回流家乡的年轻人,“大部分人回来是因为疫情,再加上那两年里大家都不想去内卷了”。                   这些回到家乡的人,几乎有同样的困扰:回乡后最难以适应的不是工作问题,而是由于生活经验和见识的差异,他们很难和周边的人进行交流。    工具使用与环境交互中的策略规划:现实世界智能体任务面对多轮工具调用,模型需要根据每次执行反馈动态调整策略,而非机械执行预设步骤。    稀疏反馈下的探索能力:性能提升往往不是线性的,模型需要在大量“看似合理但实际无效”的方向中识别真正有价值的优化路径。    系统级抽象与具体实现之间的双向翻译:从高层算法语义映射到底层硬件指令,再从硬件反馈反推优化方向,这种双向能力在科学计算、编译器设计、芯片设计等领域均有直接迁移价值。

w | 乙飞想到之前在深圳参加的活动,便效仿这种形式,在郑州做陌生人聊天饭局,每一期设置好不同的主题。         这也意味着,能在SOL-ExecBench上持续进化的模型,具备在客观物理约束下进行闭环自我改进的能力。

x | 为了避免社交变成肤浅的信息交换,他设置了一条饭局的规则——大家要“去标签化”地自我介绍和聊天。                   一开始,他感到压力很大,担心陌生人在一起会尴尬;后来他发现,不需要他来主持,人们往往自己就聊开了。人们会聊教育、医疗、裸辞,聊自由职业的选择和门路,聊人格测试……不知不觉间,这个饭局竟然办了200多期。                   这些年,随着河南文旅的发展,郑州也迎来了许多年轻游客。         三、训练侧搭建真实GPU环境,推理侧引入阿里智能体框架          智东西从千问团队获悉,在训练、推理方面,千问团队均针对Kernel Self-Evolving进行了优化。         首先在训练侧,为了让模型真正具备kernel优化能力,而非仅仅学习表面的代码模式,其构建了一套基于真实GPU环境的大规模强化学习体系。陌生人饭局里时而有从外地来旅游的人,他们经常给大家带来新鲜的体验。乙飞说,前段时间就有一个从河北来的00后医生,他在自己的小院里种菜,这样的经历引起了大家的好奇。                   随着社群人数增长,乙飞做了一个本地的户外游项目——“趣浪计划”,主打露营、徒步等主题活动的近郊游。他说,自己本身就爱玩,又会拍照、写文案、剪辑,擅长运营,可以把以前的职业经验重新应用到新的行业。

y | 他称之为“知识迁移”。

z |          1、研究人员搭建了基于沙盒的真实GPU训练环境:          为模型提供丰富的硬件文档与可交互的Workspace,使模型能够通过真实编译、执行与性能测量获取来自硬件的奖励信号,而非依赖代理指标或模拟器。                   据乙飞观察,2022年前后,很多像他这样回流或者暂时停留在郑州的年轻人,常处在一种“不知道要做什么”的真空状态中。这可以确保每一个训练信号都有真实的物理意义。         2、真实Kernel仓库作为训练数据          研究人员系统性收集了大规模真实的工程级kernel优化代码,以这些真实世界的kernel作为训练query。相比合成数据,真实反馈覆盖了更广泛的优化模式、硬件适配策略与工程取舍,为模型提供了更接近生产场景的学习信号。         3、RL基础设施的针对性优化          Kernel优化任务的一个显著特点是需要超长的工具调用序列,单次优化过程可能涉及数十乃至数百轮的编译-执行-分析循环。

|          为此,研究人员对强化学习训练基础设施进行了专项优化,使其能够高效支持超长多轮工具调用的训练,从而让模型真正学会跨越长序列的持续优化策略。而“趣浪计划”的社群成了这群人联结彼此、在此处安定下来的一个港湾。目前的近3万名用户中,有将近一半人是有过大城市生活经验甚至国外留学经验,但最终选择回到家乡的年轻人。         在推理侧,研究人员使用阿里巴巴Atrex Kernel Agent框架来承载算子优化的完整分析迭代流程与经验沉淀机制。

|                    那时候,乙飞也感受到小红书等社交平台热度的爆发式增长,“搭子文化”随着线上流量的热度转化到线下,出现了一批像乙飞这样做近郊游社群的创业者。                   大概一年后,生活恢复正常,人们对出远门游玩的热情暴涨,近郊游的人群减少了。         ▲阿里巴巴Atrex Kernel Agent框架和工作流(图源:GitHub)          在SOL-ExecBench FlashInfer-Bench子集的评测中,该模型完成了平均29354轮工具调用的持续迭代,在每一轮循环中对kernel实现进行编译、执行、性能分析与策略调整,将性能逐步推向硬件理论极限。         这意味着,模型在数万轮的迭代过程中可以保持方向一致性、持续产出有效优化、不陷入局部震荡,正是长程持续优化能力区别于普通代码生成能力的核心所在。         结语:从手写算子到AI生成、调优,Qwen3.8刷新自动化算子生成能力上限          Qwen3.8此次登顶,意味着其有能力承担底层算力优化的复杂工程任务,并进一步压缩人工介入算子开发的工作环节,其能直接对接真实硬件环境采集运行反馈,形成从算子生成到性能调优的自动化闭环。         自动化GPU算子生成赛道的长期竞争,未来或取决于大模型理解硬件架构、推演访存瓶颈、自主迭代调参的综合智能水平。长远来看,伴随大模型能力升级,模型侧与编译层在算力优化方面将形成持续双向反馈,硬件规格、算子实现、模型架构三者协同演进可能会成为常态。当初的创业者有些在疫情后回归到工作,有些因商业模式无法走通而放弃了,而乙飞坚持把品牌做了下来。

|                    接受不确定性                    在到郑州之前,乙飞是一个不折不扣的工作狂,一直把“工作不饱和”挂在嘴边。

| 在深圳的公司做运营的时候,他带着一个小团队,每天朝九晚十,工作蒸蒸日上。                   直到疫情期间,线下业务无法开展,增长停滞了,“脑袋里一直绷着的那根弦突然松下来,你就会发现很多问题”。他首先感受到的是身体的疲惫,但更多的是情绪上的问题。业务不能开展,上级的焦虑传导下来,他只能做虚空任务,焦虑和自我怀疑随之而来,整晚整晚地睡不着,到了需要找心理医生的程度。

|                    他原本准备自己创业,但2020年年末,他刚入住蛋壳公寓不久就遇到了爆雷,房间瞬间断水、断电、断网,刚交的五六千块钱也打了水漂。他一咬牙、一跺脚,当晚就收拾东西,打包了好几箱行李。把这些行李放哪儿呢?这些行李和他一样,都漂泊无根。最后他想到在郑州创业的同学,干脆把行李直接寄到了同学的办公室,随后买了一张去拉萨的机票。                   乙飞的旅行持续了一段时间,去了西藏、四川、青海,整个人也放松下来,慢慢重新思考自己的人生定位。他很清楚,在深圳,哪怕月收入两三万元,也很难在那里买房、留下来。                   在深圳的几年,虽然工作进展不错,乙飞却始终有一种自卑感,“你会发现别人从小就接触过的那些东西,你却是第一次接触”。这种自卑会导向两种结果,一种是接受,另一种是“我命由我不由天”般的努力。

| 乙飞说,他曾经拼命努力想缩小他和别人之间的差距,但心里始终有一个声音告诉他,即使努力,也弥补不了差距。                   如果不在深圳,他应该去哪里?自己以后要做什么?他的老家在新乡的农村,可对他来说回村是不可能的。他考虑过以松弛感闻名的成都,但觉得继续漂着也不是办法。后来他到郑州也不是一个“决定”,而是因为他的几大箱行李还放在朋友那里。                   2021年刚到郑州时,他在迷茫中重新找了一份互联网运营的工作。对他来说,最大的落差感是“上班时间长,但是并没有做有效工作”。一开始他以深圳速度工作,一周的工作量,他三小时就能完成,但后来他发现已经没必要和时间赛跑了。有一次,他要做一个搭建直播间的任务,原本他现学一下,两三天就能搭建出来,但是公司给他的时间是一个月。渐渐地,他“上道”了,在空余时间刷社群消息,这就是他后来做陌生人饭局和创建户外社群的开始。                   回想起来,乙飞觉得“人生好多东西都是不确定的”。当初如果不是蛋壳公寓爆雷,他就不会离开深圳,可能不会到郑州;如果不是后来运营业务与教培行业高度相关、遭遇行业滑坡,他可能不会开始创业。

| 他开始接受不确定,并在当下安定下来。                   而对于赵朝辉来说,回到漯河老家已经好几年,但那种不适应的感觉一直都在。他从初中开始就喜欢电影,职业规划一直与电影相关。

| 大学还未毕业,他就成为北漂,从剧组工作人员做起,很快接触到影视核心圈。他回想起来,那是影视行业蓬勃发展的时期,“你原本是给冯小刚、陆川和宁浩这样的大导演选剧本的,几乎天天一起工作,你接触的资源也好,周围的人的状态也罢,都让你有身处大城市的感觉”。

| 突然间回到河南,那些曾经的机会都没有了。

|                    但没想到过了几年,影视行业的黄金时期已经过去,之前的影视公司有好多已经不在了,朋友们早已各奔东西,也有许多朋友像他一样,纷纷回到老家。

|                    赵朝辉也感觉到,这些年来,北上广等大城市已不再是人们生活的唯一选择。他书店的员工,有在外地读了名牌大学的,有去外面闯过的,现在都选择回老家。                   乙飞也有相似的感觉,有了过去几年的经历,他感觉到自己的弹性在变大。

|                    和一座城市一起成长                    回家几年,赵朝辉感觉农村的环境越来越好了——家门口的土路硬化了;路上有了公共垃圾桶;原本堆满垃圾的池塘经过污水处理后变得干净了;不远处的沙河变成了国家湿地公园,附近的很多村民都会去散步。

|                    赵朝辉的爷爷当年是开私塾的,留下来不少古籍。既然扎根村里,赵朝辉便有意识地收集与当地文化相关的书籍,意图打造一个不只是书店的在地文化空间。目前,这个空间已经举办过几次活动。规划中,他还想在院子里打造观影空间,在这里,他可以重新把人聚起来。                   在书库里举办的活动。(图/由被访者提供)                    做了三年的社群和户外活动后,乙飞把自己做的事情定义为“去探索”。他觉得现在的年轻人正在过一种“被推送主宰”的生活,人们了解的关于生活的信息,大部分来自短视频平台的推送。久而久之,人们会产生认知的偏见,也会变得焦虑,会不知道自己到底要什么。                   他觉得要打破这种局面,就得自己去探索,所以他做的事情基本在线下开展。他觉得,“哪怕只是参加一次陌生人饭局,社恐的人只顾埋头吃饭都可能会有意外的收获”。

|                    这些年,随着事业慢慢有了起色,乙飞经常参加一些活动。他逐渐发现,“这座城市的想象空间还挺大的”。前几年,河南春晚爆火出圈,从河南博物院里的唐朝乐舞俑演化而来的节目《唐宫夜宴》火了。洛阳、开封等新兴旅游城市也都在向内挖掘自身的文化,吸引了许多游客前往。这让乙飞感叹“河南的文化底蕴真的很深厚”,这种自豪感是前所未有的。                   他说:“在这样的地方,你会感觉自己是与这座城市一起成长的。这是我在深圳时完全不会有的感觉。”                    乙飞举了一个例子:“就像家门口的一条路,你发现以前它只是一条小破路,今天有人来修理,明天也有人来修理,到了后天,人们在上面种上了花。虽然你没有做什么,但是你看着它在变化,你会觉得你在陪着它成长,这种感觉很开心。

|

Current article:http://druppbf.zhouangnaoguangsundianzhenmou.cfd/c7o/20260826/108610.html

Published on:02:29:10


相关文章
推荐图文
最热文章