大模型测试」共找到 9614 篇相关文章

算法论文7

姚顺雨署名:模型「现学现卖」能力首次被系统评估,腾讯、复旦联手发布CL-Bench

腾讯混元团队和复旦学研究人员联手推出全新基准测试CL - Bench,系统性评估模型上下文学习能力。测试显示十前沿模型表现不佳,揭示当前模型在该能力上的普遍短板,并指出未来四个探索方向。

AI寒武纪
开源动态7

新玩法!Karpathy周末手搓“模型智囊团”应用:各LLM同台互评,代码已开源

Andrej Karpathy周末手搓Web应用llm - council,让多个模型像顾问般提供建议。查询通过OpenRouter分发给多个模型,它们互评后由‘模型主席’生成最终回复,代码已开源。

AI寒武纪
开源动态8

马斯克转发字节Seed&哥商学院新基准:模型搞金融,连查个股价都能出错

字节跳动Seed团队与哥商学院推出开源金融搜索与推理基准测试FinSearchComp,含635个问题。评测显示模型处理金融任务有差距,凸显金融AI能力评估重要性,还揭示了关键能力差距。

量子位
算法论文8

清华&通院推出"绝对零"训练法,零外部数据模型自我博弈解锁推理能力

清华、北通院和宾州州立学研究人员提出“绝对零”训练法,让模型通过自我博弈生成并解决任务获推理能力。测试显示,其训练出的模型超专家标注样本训练的模型,且能提升编程与数学推理表现。

量子位
产品应用8

九天模型变身:性能狂飙35%!还能一键P

7月26日,中国移动在2025世界人工智能会发布「九天」基础模型3.0,端到端技术全面升级,复杂推理能力提升35%,智能体调用效率提升21%,还推出代码、数学等专项模型,多模态能力也焕新。

新智元
新闻资讯7

Show me《指环王》!卡帕西强推模型评测新基准

神卡帕西宣称Anthropic用《指环王》给模型评测上强度,这一‘指环王基准’正接替‘鹈鹕骑自行车’SVG测试。虽Opus 5生成的画面粗糙,但网友测试展现出丰富创意,不过新测试也引发争议。

量子位
开源动态8

文心模型 4.5 系列正式开源,涵盖 10 余款模型

6月30日,百度正式开源文心模型4.5系列,含10款模型,实现预训练权重和推理代码全开源。可在飞桨星河社区等平台下载,百度实现框架与模型“双层开源”,技术创新多,性能表现优。

AI前线
新闻资讯7

模型IMO25数学竞赛成绩公布了

模型挑战IMO 2025成绩出炉,Gemini 2.5 Pro以超30%总成绩断崖式领先,超出第二名89%。测试由MathArena组织,采用统一环境和双人匿名评估。还介绍了测试模型、题目及模型表现,人类版结果预计本周六发布。

量子位
算法论文8

告别单一模型依赖!北航等机构发布综述:语言模型集成(LLM Ensemble)

北航等机构发布的论文系统性回顾了LLM Ensemble领域进展,介绍分类法、相关问题、方法、基准、应用和未来方向。LLM Ensemble指推理阶段综合利用多模型优势,现有推理前、中、后三集成范式。

PaperAgent
算法论文8

牛津VGG、港、上交发布ELIP:超越CLIP等,多模态图片检索的增强视觉语言模型预训练

牛津VGG、港、上交团队论文提出ELIP方法,用学术界资源增强视觉语言模型预训练,用于文字 - 图片检索。该论文被会接受并获最佳论文提名。ELIP可应用于多个模型,实验显示能显著提升图片检索表现。

机器之心