智源大会」共找到 5916 篇相关文章

算法论文8

语言模型离“数学证明高手”还有多远?斯坦福、伯克利、MIT 团队提出 IneqMath 评测标准

现在很多语言模型常给出看似正确的结论,但推理过程却有问题。斯坦福、伯克利和MIT团队提出新思路,构建IneqMath数据集及‘AI数学裁判系统’,研究发现很多模型推理不严谨,还给出两个提升准确率的办法。

AI前线
开源动态8

性能比肩DeepSeek-R1,MiniMax仅花380万训出推理模型性价比新王|开源

MiniMax开源推理模型MiniMax - M1,原生支持100万token输入、8万输出,性能比肩DeepSeek - R1,仅花380万训成。采用Lightning Attention机制与CISPO算法,在多领域表现出色,模型权重可在HuggingFace下载。

量子位
推荐文章7

厂设计师到超级一人公司:6000字回顾我和AI的2025

作者回顾2025年,身份从厂设计师变为自由职业者,用AI加持做超级一人公司。自媒体上各平台粉丝量增长,开始做视频;社群活动帮创业者和员;创作涵盖Vibe Coding、Agent、图像视频等;还介绍合作产品,展望2026年AI趋势。

歸藏的AI工具箱
开源动态8

社区供稿丨如何抑制模型的“过度反思”:Yuan3.0 Flash 中的强化学习范式

模型在企业落地时存在“过度反思”问题,浪费算力。YuanLab.ai团队在Yuan3.0 Flash模型中提出RIRM与RAPO,前者奖励“思考过程”,后者优化训练框架,实现推理效率提升,适用于企业场景。

Hugging Face
新闻资讯7

劝人退学、庆幸没读博浪费5年,26岁DeepMind“传奇人物”:厂内部分散,AI研究很低效

26岁的Neel Nanda是DeepMind“传奇人物”,他涉足机械可解释性研究四年成果丰硕。在与主持人对话中,他分享经验,认为厂内部分散、AI研究低效,还谈及读博、AI安全研究、公司决策等看法。

AI前线
算法论文8

AAAI 2026|视频语言模型到底可不可信?23款主流模型全面测评来了

合肥工业学与清华学团队推出视频语言模型综合可信度评测基准 Trust-videoLLMs,对 23 款模型从五维度 30 项任务评测,揭示性能格局,指出模型现存问题,还开源评测框架等。

机器之心
新闻资讯7

老黄玩Nano Banana上瘾,拉着哈萨比斯夸特夸,“不有人不喜欢吧?”

英伟达CEO黄仁勋公开宣称是Nano Banana的忠实粉丝,还向DeepMind CEO哈萨比斯夸特夸。他也常用多种AI工具处理事务,提升效率。Nano Banana有新玩法,让Gemini走红,拉下ChatGPT下载量榜首。

量子位
产品应用8

比英伟达早,比李飞飞强,晓Kairos原生一体化世界模型定义物理AI新路线

晓机器人发布 Kairos 开悟世界模型,其首创“多模态理解 — 生成 — 预测”原生一体化架构,采用跨具身渐进式训练体系和“以人为中心”的数据金字塔,还实现端侧部署,在四权威具身智能基准上全面登顶。

机器之心
算法论文7

一招缓解LLM偏科!调整训练集组成,“秘方”在此 | 上交&上海AI Lab等

上海交和上海AI Lab联合团队提出IDEAL方法,可提升LLM综合性能。研究发现SFT阶段数据数量非关键,配比不当加剧模型“偏科”。以Llama3.1 8B测试,IDEAL能提升代码能力,还指导了超参数选取。

量子位
产品应用8

医疗幻觉率比DeepSeek低3倍,百川循证增强模型横扫全球医学考试!

百川智能发布首个循证增强医疗模型Baichuan - M2 Plus,将循证医学理念融入训练和推理,首创六源循证范式。其在多场景评测中幻觉率低,多国医考成绩优异,已上线百小应APP并开放API。

新智元