模型能力提升」共找到 9790 篇相关文章

开源动态8

准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用

近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。

量子位
算法论文8

基础模型已颠覆科研,进入第五范式!港科大综述113篇论文 | NeurIPS'25

港科大论文指出,随着科学问题复杂度提升,传统科研范式显露出局限。基础模型(FMs)横空出世,具备通用性、规模与知识覆盖、推理与生成能力,可能引领科学进入第五范式,但也面临偏见、幻觉等问题。

新智元
开源动态8

英伟达4段简短提示词,IOI夺金!开源模型也能征服最难编程竞赛

英伟达研究者提出GenCluster框架提升开源LLM解题能力,让开源模型gpt - oss - 120b在IOI 2025获金牌级别高分。它执行‘海选+筛选+比拼+提交’流程,优势明显,标志开源AI里程碑式突破。

新智元
产品应用8

vivo发布端侧多模态模型,只有3B可理解GUI界面,20项评测表现亮眼

vivo AI Lab发布端侧多模态模型BlueLM - 2.5 - 3B,融合文本与图文能力,支持长短思考模式切换。它在20余项评测中表现出色,参数量小,训练和推理成本低,有精巧结构、高效策略,还有高质量数据和高性能平台支撑。

量子位
新闻资讯7

刚刚,大模型棋王诞生!40轮血战,OpenAI o3豪夺第一,人类大师地位不保?

国际象棋积分赛成果出炉,OpenAI o3以人类等效Elo 1685分夺冠,Grok 4和Gemini 2.5 Pro紧随其后。Kaggle发布国际象棋文本排行榜,评估模型战略推理等能力,还推出相关数据集,虽有局限但意义重大。

新智元
开源动态8

终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成

过去两年视频生成模型不断提升画面参数,但传统模型生成的视频固定,用户无法干预。而世界模型可跟随操作实时渲染、动态生成世界。目前Noiz AI联合多机构发布实时可交互音视频世界模型HelixWorld 1.0,后续还将开源。

量子位
新闻资讯7

爆冷!首届大模型争霸,Grok 4下出「神之一手」?DeepSeek、Kimi惨遭淘汰

谷歌Kaggle举办首届全球AI象棋争霸赛,八款顶级语言模型正面对抗。首战8进4淘汰战中,Gemini 2.5 Pro、o4 - mini、Grok 4、o3晋级,Claude 4 Opus、DeepSeek R1、Gemini 2.5 Flash和Kimi K2出局。比赛考验AI整体理解能力

新智元
产品应用7

“光靠人盯不住了”!拆解上万张晶圆,这家公司靠 AI 将芯片良率提升数个百分点

喆塔科技创始人赵文政看好半导体软件领域引入AI技术。喆塔将DeepSeek接入自研模型,应用机器学习算法提升半导体企业良率,构建智能生态系统,产品获客户认可,未来将加大研发投入。

InfoQ
算法论文8

全图与切片并非等价?LLaVA-UHD-v3揭示差异推出高效全图建模方案

随着多模态大模型发展,处理高分辨率图像成关键。主流视觉编码范式难兼顾性能与效率,清华和中科院团队发布 LLaVA-UHD v3,提出 PVC 框架,对比 SBE 和 GNE,验证其在提升效率同时保留模型能力

机器之心
算法论文7

SnapMoGen:44 小时动作数据 + 12 万文本注释,文本驱动动作生成数据集

近年来文本驱动动作生成有进展,但受限于数据集质量。Snap团队提出SnapMoGen数据集和MoMask++模型。前者有2万条动作片段和12.2万条文本描述,后者建模更有效,还结合LLM提升适用性,但二者都有局限。

带你学AI