GPT-5.6 Sol 视觉能力暴涨三倍:目标检测得分 46.2,OpenAI 最强视觉模型登顶
8月19日消息,第三方视觉评测机构 Roboflow 近日将 GPT-5.6 全系模型接入自家 VLM 基准进行全面测试,结果显示旗舰档 Sol 的目标检测得分从上一代 GPT-5.5 的 13.8 分飙升至 46.2 分,提升逾三倍。Roboflow 项目负责人 SkalskiP 直言,Sol 是 OpenAI 有史以来最强的视觉模型。
目标检测历来是 GPT 系列模型的弱项:任务要求模型在图片中把每个物体准确框出,而上一代 GPT-5.5 的表现几乎等于「知道图里有东西,框哪儿全靠蒙」。此次 Sol 拿下 46.2 分,连同中档 Terra 的 44.7 分、入门档 Luna 的 43.3 分,整个 GPT-5.6 家族已集体脱离此前的「视觉盆地」。
目标检测:从交白卷到三倍飞跃
在 Roboflow 的 VLM 基准中,GPT-5.6 Sol 的目标检测得分较 GPT-5.5 的 13.8 分增长三倍以上。更值得注意的是入门档 Luna 的表现——作为本代最便宜的档位,它 43.3 分的检测成绩依然把上一代旗舰按在地上摩擦。计数方面同样全线走高,Sol 的准确率从 GPT-5.5 的 64.9% 升至 73%,Terra 与 Luna 分别达到 67.6% 和 66.2%。
图:GPT-5.6 Sol 预览版发布,视觉能力成为本轮升级重点
文档版面识别:最亮眼的隐藏技能
文档版面识别是 GPT-5.6 提升最明显的能力。标题、正文、表格、插图、签名,Sol 都能干净利落地圈出来。这对合同、发票、报表处理类场景意义重大——几乎所有文档流水线的第 一步,都是先找到「该看哪一块」,再去认字。面对药片、鸡蛋这类几十个同款物体挤在一起的密集场景,Sol 同样扛住了:大模型画框需要逐个坐标输出,物体越多、输出越长,漏框与坐标写飞的概率越高,而 Sol 在测试中保持了稳定表现。
短板仍在:OCR 定向提取不升反降
最反常识的结论出现在认字能力上。OCR 整段转写 Sol 拿到 90.7%,比 GPT-5.5 的 91.2% 略低半个点;而「定向提取」——只取发票日期等单条信息——Sol 只有 82.5%,较上一代的 87.6% 掉了 5 个百分点。它能整段转写手写笔记、读得出脏轮胎弧面上的尺寸编号、按指定格式吐出冰球比赛直播比分,却读不出药板上那行字小、竖排、低对比度、带反光的有效期。
Roboflow 还把部分「检测框飘到画面无关位置」的样例发给 OpenAI,对方回应称:Sol 在图片达到 2000×2000 像素或更大时会变得不稳定,推理档位调得越低越不稳定,建议调高推理档位,或先把图片缩小再送入 API。
成本与稳定性:性价比战争刚刚开始
Roboflow 实测的调用成本与速度为:Sol 约 2.5 美分/张、约 10 秒;Terra 约 1 美分/张、约 6 秒;Luna 不到 0.5 美分/张、约 5 秒。作为参照,Gemini 3.5 Flash 每张约 0.8 美分,比 Sol 便宜三分之二,且在这套基准上的检测与计数依然领先,是高频、大批量检测任务中的「性价比之王」。
在测试方看来,GPT-5.6 Sol 此次真正令人意外之处,是视觉能力正从「看懂一张图」跨进「真正干视觉的活」:找目标、画框、计数、理解空间关系、拆文档版面,这些过去属于专用视觉模型的地盘,如今正被大模型一点点吃掉。视觉大模型的下半场,已经从「能不能看懂」卷向「干活准不准」——GPT-5.6 亮出了肌肉,但性价比的较量才刚刚开始。