大模型测试」共找到 9653 篇相关文章

算法论文8

都在卷「让模型多循环几遍」,这个7B模型LoopCoder v2说:多循环 1 次就够了

一项新研究表明,7B小模型LoopCoder v2在正常计算外多循环一次,就能在SWE - bench Verified基准上幅提分。继续增加循环次数,性能反而下降。研究还算了‘收益 - 成本’账,给出选择循环次数的诊断方法。

AIGC开放社区
算法论文8

比思维链准43%!逻辑脑+模型直觉,推理可靠性幅提升

中德研究团队发布成果,给模型外挂「逻辑脑」,结合答案集编程与LLM,构建神经 - 符号框架,提升空间推理准确率,让AI能说清逻辑、跨任务迁移,迈向更可靠的通用推理。

新智元
推荐文章7

Transformer | 一文带你了解Embedding(从传统嵌入方法到模型Embedding)

文章介绍Embedding基础知识,从传统统计方法到如今模型用例演变过程。涵盖传统、静态、上下文及模型Embedding技术,如TF - IDF、word2vec、BERT等,还剖析DS - Qwen1.5B的Embedding并以图展示。

AINLPer
算法论文8

模型越聪明越“不听话”?MathIF基准揭示AI服从性漏洞

上海人工智能实验室与香港中文学研究团队发布论文,用MathIF基准揭示模型“聪明”和“听话”有矛盾,越擅长推理越易忽略指令,还分析了原因并给出让模型更“听话”的方法。

深度学习自然语言处理
新闻资讯7

谷歌技术报告披露模型能耗:响应一次相当于微波炉叮一秒

模型耗电舆论高,谷歌用数据还击。谷歌首席科学家称Gemini能耗低于预期,一年间能耗降至1/33,碳排放降至1/44。谷歌用更全面指标计算能耗,还从多方面优化使Gemini能耗降低。

量子位
算法论文8

联合字节跳动提出JoVA: 一种基于联合自注意力的视频-音频联合生成模型

香港学联合字节跳动提出视频 - 音频联合生成框架 JoVA,支持音视频 Token 跨模态交互,引入嘴部区域特定损失解决口型同步问题。实验显示,它用约 190 万条数据就达先进水平。

机器之心
开源动态8

测试时也能RL,英伟达等提出全新范式:TTT-Discover

近日,斯坦福、英伟达、Together AI 等联合开源全新测试时新范式 TTT - Discover,在测试阶段用强化学习微调模型,以刷出 single best 结果,用几百美元就刷新诸多领域 SOTA。

PaperAgent
推荐文章7

模型协同架构在金融智能投顾中的应用与挑战

本文整理自北银金科高级算法专家尹辰轩分享,介绍模型协同架构下的模型投顾方案,能解决幻觉问题、优化回答深度。还提到 12 月 19 - 20 日 AICon 北京站聚焦多热门方向。

InfoQ
新闻资讯7

刚被马斯克收购,Cursor掏出新模型:10万卡加持,和Opus、GPT一样

本周二,刚被SpaceX收购的Cursor在首届旗舰会宣布新的1.5万亿+参数模型,在超10万块GPU预训练。Cursor CEO称其规模与Opus、GPT相当,还谈了对其他AI实验室看法,新模型将几周内发布。

机器之心
开源动态8

AIME'25满分炸场!Qwen一波七连发,全家桶更新

云栖会上,通义团队成果丰硕。Qwen3-Max性能提升,数学评测满分,多测试成绩优异;Qwen3-VL、Qwen3-Omni等开源,各有亮点;Qwen3-Coder升级。吴泳铭称要发展超级人工智能。

量子位