
万博manbext网站登录这是何如一趟事?GenExam:不啻是"绘画"-万博manbext网站登录 万博manbext体育官网注册账号入口
新闻中心
从 GPT-4o 到 Nano Banana、Seedream 4.0,本年的大模子想要出圈万博manbext网站登录,"画得好"俨然成了必杀技。 不外,在比拼着实感、艺术性方面,生图模子是伟人打架,在"作念题"上,现如今的模子们又到底身手几何? 比如,当领导变成画出 1- 甲基环己烯酸催化水合的反映机理、把柄给定的边集画出图的最小生成树,模子能否像有关专科的东谈主类考生雷同,真确把常识浮现、推理和作图结合在一齐? 针对这个问题,上海东谈主工智能履行室、上海交大、清华大学、香港汉文大学集会髻布
详情

从 GPT-4o 到 Nano Banana、Seedream 4.0,本年的大模子想要出圈万博manbext网站登录,"画得好"俨然成了必杀技。
不外,在比拼着实感、艺术性方面,生图模子是伟人打架,在"作念题"上,现如今的模子们又到底身手几何?
比如,当领导变成画出 1- 甲基环己烯酸催化水合的反映机理、把柄给定的边集画出图的最小生成树,模子能否像有关专科的东谈主类考生雷同,真确把常识浮现、推理和作图结合在一齐?
针对这个问题,上海东谈主工智能履行室、上海交大、清华大学、香港汉文大学集会髻布了首个多学科文生图磨练基准 GenExam。

这一基准参考东谈主类磨练中的作图题,诡秘 10 个学科、1000 个严选好题,用"磨练念念维"再行界说文生图模子的身手领域。
履行成果却让东谈主大跌眼镜:即就是 GPT-4o 这么的顶级模子,严格评分下正确率也仅 12.1%,开源模子更是全部接近 0 分。

这是何如一趟事?
GenExam:不啻是"绘画",更是"面向 AGI 的概述测试"
磨练是计算东谈主类达到大家级智能的过失圭臬,这在理衔命务的 MMMU 等基准上还是很有体现。GenExam 则将文生图也视为"东谈主类学科磨练",和传统文生图基准彰着不同。它涵盖数学、物理、化学、生物、规画机、地舆、经济、音乐、历史、工程 10 个一级学科,每个学科都聚焦"绘图类考题",题目经过 GPT-5 初筛与东谈主类审核把关,确保严谨性。

雷同东谈主类磨练,GenExam 的"学科绘图题"有四大中枢特征:
"题目"(文生图 prompt)各种、复杂且不断严格,平均长度达到 74.8 个单词,远超凡俗 T2I prompt,比如"用 H2SO4 和 H2O 动作催化剂,画出 1- 甲基环己烯的酸催化水合反映机理,明确反映物、反映条款、主居品,并把柄马尔科夫规定标注羟基位置";
有明确的"参考谜底"(ground truth 图像)晋升评测准确性,有"评分圭臬"(评分点)逐点检查正确性,平均每谈题 6.9 个评分点,比如"催化剂是否为 H2SO4 和 H2O "、"反映物是否为 1 号位有甲基、包含双键的六元环",每个得分点对应不同权重。
学科常识诡秘深且广,可系统化层级分类,造成严格的"四级学科分类体系"。
需要模子和会浮现(读懂考题)、推理(推导经由)、生成(精确绘图)三大身手。
细粒度评测体系

传统文生图评测总纠结"像不像"、"好意思不好意思",但学科绘图更介意"对分歧"——化学结构中的一个碳原子 / 物理电路图中的一个箭头画错,通盘图就错了。
为此,GenExam 联想了双维度、两圭臬的评测体系,用 GPT-5 动作"自动阅卷诚挚",确保评分客不雅准确:
两大评测维度
语义正确性:模子画的是不是"相宜题意"?基于每谈题的评分点,让 GPT-5 作念视觉问答(比如"分子是否含 8 个碳原子?"),并提供 ground truth 图片动作参考晋升评分准确性,将作念对的题的分数之和动作语义分数;
视觉合感性:画对了,但"卷面"好不好?分三项打分。
拼写:公式、标签有莫得拼写错;
逻辑一致性:坐标、刻度是不是对应;
可读性:元素有莫得禁锢、标签是不是明显。
严格 / 宽松双圭臬
严格得分:只须语义全对 + 视觉合感性三项全满分才算正确;
宽松得分:语义(70% 权重)+ 拼写(10%)+ 逻辑(10%)+ 可读性(10%)的加权平中分,给模子"部分得分"的空间,顺应分手模子间的相对差距。
顶尖模子也不足格,开源模子拔本塞源

团队测试了 18 个主流模子,包括闭源"顶流"(举例 GPT-Image-1(GPT-4o)、Gemini-2.5-Flash-Image(Nano Banana))、开源专用文生图模子(举例 Qwen-Image、FLUX.1 dev)、浮现生成一体化模子(举例 BAGEL、Show-o2),成果让东谈主不测:
闭源模子:即使是发达最佳的 GPT-Image-1 严格得分也只须 12.1%。其他闭源模子分数不足 10%。这些模子能画出大约框架(比如苯环的六边形),但细节时时有严重错诞妄比如少画氢原子、键型标反)。
开源模子:整个模子严格得分均接近 0%,哪怕是发达最佳的 Qwen-Image,严格得分也只须 0.3%。长入多模态模子(如 BAGEL、Show-o2)发达还不如专用文生图模子,暴显现"整合学科常识到图像生成"的身手缺失。
当对比宽松得分时,开源模子(10~30 分)和闭源模子(50~60 分)的差距依然彰着,在语义正确性、拼写、逻辑一致性、可读性四个方面中都存在显耀互异。

诞妄案例直击痛点

通过定性分析,论文团队回来了模子的三大典型诞妄:
常识缺失:比如音乐题中画错半音圈的调号章程;
推理不足:比如几何题中算错函数交点坐标;
视觉淘气:比如拼写诞妄、标签错位(如将" -1,0 "标在 y 轴上)。

在学考场景中,任何一个小诞妄都可能导致"满盘都输"——这也恰是 GenExam 的价值地点:它精确捕捉了文生图模子在"专考场景"中的中枢短板。
通向大家级智能
GenExam 将"图像生成"滚动为"磨练任务",给文生图模子设立了一个新见解:从"画得颜面"走向"画得正确"。
刻下,即就是最顶尖的模子,在 GenExam 的磨练中也仅处于不足格水平,这既是挑战,亦然机遇——它意味着将来的模子需要在常识整合、逻辑推理、精确生成上抓续禁锢,身手真确从"通用图像生成器具"升级为"专科范围助手"。毕竟将来的 AI 不仅要会"创作艺术",更要能"援救学习"、"助力科研",而这些都离不开对学科常识的精确浮现与生成。
将来,当模子能通俗通过 GenExam 的多学科磨练时,概况咱们身手说它们真确迈入了"大家级 AGI "水平。但当今,这场磨练才刚刚开动。
GitHub 趋奉:https://github.com/OpenGVLab/GenExam
论文趋奉:https://arxiv.org/abs/2509.14232
一键三连「点赞」「转发」「提神心」
接待在驳倒区留住你的想法!
— 完 —
� � 点亮星标 � �
科技前沿进展逐日见万博manbext网站登录
