测评榜单」共找到 761 篇相关文章

算法论文8

SFT在帮倒忙?新研究:直接进行强化学习,模型多模态推理上限更高

学界常用「监督微调(SFT)+ 强化学习(RL)」训练大模型。但新研究发现,SFT 会引发「伪推理路径」,阻碍推理进步。相比之下,直接进行 RL 训练,模型多模态推理上限更高,该团队训练的模型还刷新了纪录。

机器之心
新闻资讯7

老黄自曝刚报废50亿美元显卡!亲自审查4.2万名员工薪酬,100%都加薪

黄仁勋在采访中透露报废50亿美元显卡,坚持先下先得分配H100芯片。他亲自审查员工薪酬,称100%会加薪。认为AI是伟大“技术均衡器”,天价AI合同合理,还谈及芯片保值、中美AI竞赛等话题。

新智元
新闻资讯8

HiDream-O1-World拿下WBench第一,交互世界模型的格局被改写|甲子光年

近日,智象未来的HiDream - O1 - World模型以平均分80.9登顶WBench核心Navi分,物理一致性维度也排第一。它走出第三条路线,解决时空与物理一致性难题,技术获国际顶会认可,正改变全球竞争格局。

甲子光年
新闻资讯7

人形机器人绕不开的坎:续航问题怎么破?

人形机器人续航问题常被忽视,但它面临电池重量、行走能耗、脉冲负荷三个维度约束,标称续航在实际工况会打折,工程上可通过快速换电和提升次充电电量应对,固态电池有潜力但有待验证。

DeepTech深科技
开源动态8

社区供稿 | Jina Embeddings V4: 为搜索而生,多模态多语言向量模型

Jina AI发布多模态向量模型jina-embeddings-v4,参数38亿,能同步处理文本与图像。内置LoRA适配器强化检索等任务表现,在多基准测试中展现顶尖性能,支持/多向量表示。介绍了架构、上手指南等。

Hugging Face
算法论文8

StereoAdapter:北大首提自监督,适配水下双目深度估计

水下机器人深度感知难题待解,北大等机构提出StereoAdapter框架。它结合双目视觉,以自监督学习适配视觉基础模型到水下域,设计双阶段结构、自监督训练策略等,实验效果好,未来还将多方面改进。

新智元
开源动态7

Google Design.md:一键复刻60+大厂设计规范 | 设计界的事,能叫偷吗?

今天分享Google Stitch团队提出的DESIGN.md标准,文件搞定网页设计。62个真实网站视觉语言对应的DESIGN.md可在https://getdesign.md/获取,它也是开源项目。放入项目根目录后,AI编程助手可读取生成风格一致的UI组件。

AI进修生
开源动态8

刚刚!Qwen3深夜升级,碾压Kimi K2和DeepSeek V3

通义千问更新旗舰版Qwen3模型,推出Qwen3 - 235B - A22B - Instruct - 2507 - FP8。新模型通用能力显著提升,在多测评中超Kimi - K2等模型,还增强多语言覆盖等性能,已在魔搭和Hugging Face开源。

新智元
产品应用7

高考数学全卷重赛!一道题难倒所有大模型,新选手Gemini夺冠,豆包DeepSeek并列第二

因网友质疑上次测评不严谨,此次用六款大模型挑战含解答题的全套高考数学题。结果Gemini 2.5 Pro夺冠,Doubao和DeepSeek R1并列第二。解答题是失分重灾区,图像题难倒多模态大模型。

机器之心
算法论文7

剑桥揭开大模型翻车黑箱!别再怪它不懂推理,是行动出错了

剑桥大学等机构研究指出,大模型执行长时任务易翻车,问题不在推理而在执行能力。研究人员评估多个指标,发现步准确率提升可让任务长度指数增长,还研究了自条件化等影响及模型规模的作用。

新智元