数码影音频道 频道

GPT-5.6 Sol 视觉能力暴涨三倍:目标检测得分 46.2,OpenAI 最强视觉模型登顶

“AI摘要”

OpenAI GPT-5.6全系模型在Roboflow VLM基准测试中视觉能力大幅提升,旗舰档Sol目标检测得分从GPT-5.5的13.8分飙升至46.2分,增长逾三倍,入门档Luna也超越上代旗舰。文档版面识别成为最大亮点,能精准圈出标题、表格等元素,密集场景表现稳定。但OCR定向提取得分不升反降(82.5% vs 87.6%),大尺寸图片处理不稳定。成本方面,Sol约2.5美分/张,Luna不足0.5美分/张,但Gemini 3.5 Flash性价比更高。分析认为,视觉大模型竞争已从"看懂"转向"干活准不准",性价比之战刚开始。

8月19日消息,第三方视觉评测机构 Roboflow 近日将 GPT-5.6 全系模型接入自家 VLM 基准进行全面测试,结果显示旗舰档 Sol 的目标检测得分从上一代 GPT-5.5 的 13.8 分飙升至 46.2 分,提升逾三倍。Roboflow 项目负责人 SkalskiP 直言,Sol 是 OpenAI 有史以来最强的视觉模型。

目标检测历来是 GPT 系列模型的弱项:任务要求模型在图片中把每个物体准确框出,而上一代 GPT-5.5 的表现几乎等于「知道图里有东西,框哪儿全靠蒙」。此次 Sol 拿下 46.2 分,连同中档 Terra 的 44.7 分、入门档 Luna 的 43.3 分,整个 GPT-5.6 家族已集体脱离此前的「视觉盆地」。

目标检测:从交白卷到三倍飞跃

在 Roboflow 的 VLM 基准中,GPT-5.6 Sol 的目标检测得分较 GPT-5.5 的 13.8 分增长三倍以上。更值得注意的是入门档 Luna 的表现——作为本代最便宜的档位,它 43.3 分的检测成绩依然把上一代旗舰按在地上摩擦。计数方面同样全线走高,Sol 的准确率从 GPT-5.5 的 64.9% 升至 73%,Terra 与 Luna 分别达到 67.6% 和 66.2%。

图:GPT-5.6 Sol 预览版发布,视觉能力成为本轮升级重点

文档版面识别:最亮眼的隐藏技能

文档版面识别是 GPT-5.6 提升最明显的能力。标题、正文、表格、插图、签名,Sol 都能干净利落地圈出来。这对合同、发票、报表处理类场景意义重大——几乎所有文档流水线的第 一步,都是先找到「该看哪一块」,再去认字。面对药片、鸡蛋这类几十个同款物体挤在一起的密集场景,Sol 同样扛住了:大模型画框需要逐个坐标输出,物体越多、输出越长,漏框与坐标写飞的概率越高,而 Sol 在测试中保持了稳定表现。

短板仍在:OCR 定向提取不升反降

最反常识的结论出现在认字能力上。OCR 整段转写 Sol 拿到 90.7%,比 GPT-5.5 的 91.2% 略低半个点;而「定向提取」——只取发票日期等单条信息——Sol 只有 82.5%,较上一代的 87.6% 掉了 5 个百分点。它能整段转写手写笔记、读得出脏轮胎弧面上的尺寸编号、按指定格式吐出冰球比赛直播比分,却读不出药板上那行字小、竖排、低对比度、带反光的有效期。

Roboflow 还把部分「检测框飘到画面无关位置」的样例发给 OpenAI,对方回应称:Sol 在图片达到 2000×2000 像素或更大时会变得不稳定,推理档位调得越低越不稳定,建议调高推理档位,或先把图片缩小再送入 API。

成本与稳定性:性价比战争刚刚开始

Roboflow 实测的调用成本与速度为:Sol 约 2.5 美分/张、约 10 秒;Terra 约 1 美分/张、约 6 秒;Luna 不到 0.5 美分/张、约 5 秒。作为参照,Gemini 3.5 Flash 每张约 0.8 美分,比 Sol 便宜三分之二,且在这套基准上的检测与计数依然领先,是高频、大批量检测任务中的「性价比之王」。

在测试方看来,GPT-5.6 Sol 此次真正令人意外之处,是视觉能力正从「看懂一张图」跨进「真正干视觉的活」:找目标、画框、计数、理解空间关系、拆文档版面,这些过去属于专用视觉模型的地盘,如今正被大模型一点点吃掉。视觉大模型的下半场,已经从「能不能看懂」卷向「干活准不准」——GPT-5.6 亮出了肌肉,但性价比的较量才刚刚开始。

0
相关文章