商汤又“夺金”!SuperCLUE-V多模态大模型基准发布10月榜单

  在这个金秋,“日日新·商量”又拿了金牌!

  今日,中文多模态大模型测评基准 SuperCLUE-V 发布 10 月榜单:

  商汤日日新·商量多模态大模型(SenseChat-Vision5.5)凭借多个任务上的出色表现,总得分位列国内大模型第一梯队,智夺金牌。

商汤又“夺金”!SuperCLUE-V 多模态大模型基准发布 10 月榜单
 

  商量多模态大模型 API 入口(限时免费!):https://platform.sensenova.cn/doc?path=/model/mllm.md

  商汤“商量”注册体验链接:https://chat.sensetime.com/

  凭借其卓越的多模态基础能力和出色的应用能力,商汤 SenseChat-Vision 5.5 荣获了总分 73.56 的高分,并在数理逻辑维度取得第一,体现其强大的推理能力。

  SenseChat-Vision5.5 基础能力突出,数理逻辑维度超越 GPT-4o

  本次 SuperCLUE-V 涵盖了国内外最具代表性的 11 个开源/闭源多模态理解大模型,聚焦多维度能力评估,包括基础能力和应用能力两个大方向,以开放式问题形式对多模态大模型进行评估,涵盖了 8 个一级维度 30 个二级维度。

  报告称 SenseChat-Vision 5.5 在基础能力-数理逻辑推理任务如图表推理、场景推理方面具备领先优势。榜单显示,在数理逻辑分析能力中,SenseChat-Vision 5.5 超越国内外所有参评模型包括 GPT-4o 的最新版本,位列第一。

商汤又“夺金”!SuperCLUE-V 多模态大模型基准发布 10 月榜单
 

商汤又“夺金”!SuperCLUE-V 多模态大模型基准发布 10 月榜单
 

  SuperCLUE-V 采用细粒度评估方式,构建专用测评集,每个维度进行细粒度的评估并可以提供详细的反馈信息,以下为 SenseChat-Vision 5.5 测试案例部分呈现:

商汤又“夺金”!SuperCLUE-V 多模态大模型基准发布 10 月榜单
 

商汤又“夺金”!SuperCLUE-V 多模态大模型基准发布 10 月榜单
 

商汤又“夺金”!SuperCLUE-V 多模态大模型基准发布 10 月榜单
 

  目前,多模态大模型能力显著提升,可提供纯语言、多图理解、语音、文生图、拟人、端侧模拟、行业模型等多模态、多版本、强场景 Agent 形态。

  前瞻构造高阶思维逻辑数据,用推理能力增强 AI 大模型智能

  如今,复杂推理成为各模型之间的重要能力壁垒。对于大模型能力的分层,商汤科技董事长兼首席执行官徐立博士此前就提出三层架构(KRE)理论,即:第一层知识(Knowledge),世界知识的全面灌注;第二层推理(Reasoning),理性思维的质变提升;第三层执行(Execution),世界内容的互动变革。

商汤又“夺金”!SuperCLUE-V 多模态大模型基准发布 10 月榜单
 

  这三层可以组成一个对于世界提供生产力工具模型的完备能力,其中提升基础模型的推理能力是目前人工智能发展的大方向。徐立博士还提出在垂直行业里如何构造高阶思维逻辑的合成数据,也是制胜关键。

  今年 7 月发布的“日日新 5.5”大模型体系就创新使用大量使用合成高阶思维链数据,提升推理思维能力,在数理逻辑、英文、指令跟随等方面能力增强明显,2 个多月的时间把基模型的能力提升了 30%。

  未来,商汤科技将继续坚持基础大模型的持续研发与投入,前瞻探索最先进的大模型技术,突破数据与算力的限制,引领大模型的创新与落地。