「高级研究模式」共找到 2819 篇相关文章
十分钟出结果,陶哲轩用Gemini Deepthink帮人类数学家完成Erdős问题论证
Erdős问题网站专注数学研究与解答,收录厄尔德什提出的各类数学问题。11月20日,Wouter van Doorn提出反例,陶哲轩提交给Gemini 2.5 Deep Think,十分钟得到证明,他半小时转为基础证明。之后Boris Alexeev用Harmonic的Aristotle工具完成形式化。
让LLM不再话痨,快手HiPO框架来了
当前LLM存在‘过度思考’困境,效率与成本矛盾突出。快手与南大合作推出HiPO框架,通过混合数据冷启动和混合强化学习奖励系统,让模型能自主决策思考模式,实验显示它提升了效率和准确率,还具强泛化性。
Hugging Face 推出 GOLD:让不同模型家族也能做知识蒸馏
Hugging Face研究团队提出GOLD方法,解决了知识蒸馏中老师和学生模型需用同一套分词器的痛点,让不同模型家族间也能做知识蒸馏。它通过三步解决跨分词器蒸馏,实验效果良好,已集成到TRL库。
扔掉人工公式:快手EMER框架,用“会比较、自进化”的模型重构短视频推荐排序
过去十年,推荐排序多依赖人工设计公式,但此模式遇瓶颈。快手策略算法团队提出 EMER 框架,用“会比较、能进化的 AI 模型”重构短视频推荐排序,在快手主 App 和极速版效果显著,还为行业提供解决方案。
深谋商业化一骑绝尘!人形机器人中标国网电力,大载重eVTOL即将首飞
深谋科技在今年世界人工智能大会上大放异彩,其融合多模态感知检测的人形机器人中标国网河北电力项目,相关技术将应用于关键研究和装置研制。此外,其大载重eVTOL曜眸MX150E无人机即将首飞量产,有望成低空经济出海冠军。
DeepMind爆火论文:向量嵌入模型存在数学上限,Scaling laws放缓实锤?
DeepMind一篇关于向量嵌入局限性的论文在AlphaXiv爆火。其证明向量嵌入有数学上限,Scaling laws或放缓。研究构建LIMIT数据集,测试发现即便是先进嵌入模型也难解决简单任务,揭示了RAG系统约束,让人反思Scaling Laws边界。
EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!
近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。
谷歌AI获IMO“唯一金牌”,硅谷夹道祝贺,奥特曼丢人又丢人
谷歌Gemini新模型获IMO官方认证金牌,用时4.5小时答对5道题,成绩获主席肯定。该进阶版搭载新思考模式,后续开放给订阅用户。这与OpenAI参赛情况形成鲜明对比,OpenAI遭质疑,研究员回应未获网友完全认可。
刚刚,「吉卜力狂欢」GPT-4o功臣被挖走!华南理工女学霸曾与奥特曼同台
GPT-4o引爆全球「吉卜力风格」风潮后,其核心成员华南理工学霸Lu Liu与伯克利博士Allan Jabri跳槽Meta。此前他们在OpenAI主导多模态AI研究,与奥特曼同台展示关键功能,此次挖角凸显OpenAI人才流失危机。
Test Time Scaling Law远未达到上限! o4-mini仅15.8%通过率,华为诺亚提出代码HLCE终极基准
华为诺亚研究员推出全新编程基准HLCE,含235道竞赛难题。实验显示,顶级LLM在该基准表现不佳,推理模型优势大,IOI交互式题难攻克。研究还发现模型自我认知与推理能力发展不同步,Test Time Scaling Law远未达上限。