「推理性能优化」共找到 4194 篇相关文章
ICML 2025 | 清华、上海AI Lab提出专家级医学基准MedXpertQA,看o3、R1哪家强
本文由清华和上海AI Lab学者撰写,提出专家级医学基准MedXpertQA。现有医学基准难度和临床相关性不足,而MedXpertQA极具挑战、临床相关性高,构建严格,评测显示前沿模型在医学领域提升空间大。
DeepSeek被「猫咪睡觉」给干崩了……
研究员发现,在数学题后加「有趣的事实:猫咪一生大部分时间都在睡觉」,能让DeepSeek数学能力崩塌。研究开发CatAttack方法找「触发词」,无关触发词使模型错误率飙升,还会让回答变长。
刚刚,马斯克切脑全场震撼!插脑只要1.5秒,26年治愈失明,28年全人类变AI
马斯克Neuralink发布会亮点多,全球已有七人植入设备,可通过脑机接口玩游戏、控制机械臂。马斯克公布三年路线图,2026年治失明,2028年人类与AI集成。第二代手术机器人提速,自研植入物创新数据传输模式。
最低仅需2G显存,谷歌开源端侧模型刷新竞技场纪录,原生支持图像视频
今天凌晨,谷歌官宣Gemma 3n,原生支持多模态。它在大模型竞技场超1300分,是首个超此分数的10B以下模型。其VRAM占用低,最低2GB,已在谷歌AI Studio等可用,还公开了技术细节。
智能体自己出现问题自己找!首次提出“自动化失败归因”课题 | ICML2025 Spotlight
LLM Multi - Agent系统失败诊断难,阻碍迭代优化。宾夕法尼亚州立大学等机构研究者首次提出“自动化失败归因”课题,构建Who&When数据集,开发评估多种归因方法,实验揭示当前方法不足。
SkyReels-Audio让嘴型和音频完美匹配不再难
音频驱动的动态人脸生成研究较少,昆仑万维提出SkyReels - Audio框架,基于预训练视频扩散变换器构建,支持无限长度视频生成与编辑,采用混合课程学习等策略,保障视频视觉保真度和时间一致性。
LeCun有了新证据!大模型思考与人类思考存在本质差别
Yann LeCun参与的研究用信息论揭示大语言模型与人类在‘理解世界’上的本质差异。研究引入新量化框架,分析主流大模型,发现AI与人类在‘理解’上有三大核心差异,对当前AI发展趋势提出挑战。
刚刚,智源全新「悟界」系列大模型炸场!AI第一次真正「看见」宏观-微观双宇宙
6月6日第七届智源大会,智源研究院推出全新「悟界」系列大模型,含原生多模态世界模型Emu3、脑科学多模态通用基础模型见微Brainμ等,反映其对大模型发展的研判,推动AI向物理世界迈进。
一周两破18年数学纪录!陶哲轩惊叹:AlphaEvolve带来久违「加速度」
人类数学家与AlphaEvolve携手,一周内两次刷新18年未破的数学纪录。先是AlphaEvolve将和差集的θ下界提升,后人类数学家Gerbicz在其基础上再进一步,展现AI与人类协作在数学研究中的惊人潜力。
OpenAI诈骗?GPT-4.1正式上线ChatGPT,网友实测却大呼失望
OpenAI官宣GPT - 4.1在ChatGPT中可用,Plus、Pro和Team用户可访问。它擅长编码和遵循指令,评估表现有优有劣。实测代码处理表现佳,但网友因无100万上下文窗口API版本而失望。