「通用推理系统」共找到 4163 篇相关文章
ICLR 2026 Oral | 西湖大学发布Real PDE Bench
复杂物理系统时空演化预测是核心问题,当前AI模型多在数值仿真数据上训练,难以评估其在真实数据上的表现。西湖大学等实验室提出RealPDEBench,含真实与仿真数据,设三类任务、九个评估指标和十个基线方法。
Claude版Manus只用10天搓出,代码全AI写的!网友:小扎140亿并购像冤大头
Claude Cowork是面向工作场景的通用智能体,基于Anthropic自研模型打造。开发约10天,代码全由Claude Code写,人类仅负责规划等。它让非编程用户能用AI能力,这让扎克伯格20亿买Manus的操作显得冤。
网民票选AI王者,LMArena一夜变17亿美元独角兽!
LMArena原是校园开源小项目,从2023年起步,如今估值达17亿美元。其Arena模式让网友盲投选AI,Elo评分系统算排名。虽有众包投票易操纵等争议,但已成行业标杆,还将为大厂提供付费评估服务。
黄仁勋手撕「AI泡沫」论!英伟达570亿铁拳暴击,显卡全断货
英伟达Q3 2026财报显示单季度营收达570亿美元,数据中心业务同比狂涨66%。黄仁勋称AI不是泡沫,而是计算范式从通用CPU转向加速式GPU计算的必然。当前多数AI公司估值高、收入低,英伟达作为‘卖铲人’大获全胜。
NVIDIA港大MIT联合推出Fast-dLLM v2:端到端吞吐量提升2.5倍
自回归大语言模型推理效率受限,Fast - dLLM v2 由 NVIDIA、港大、MIT 联合推出。它将预训练 AR 模型适配为能并行解码的 Block - dLLM,用约 1B tokens 微调,端到端吞吐量最高提升 2.5 倍,精度相当。
医疗幻觉率比DeepSeek低3倍,百川循证增强大模型横扫全球医学考试!
百川智能发布首个循证增强医疗大模型Baichuan - M2 Plus,将循证医学理念融入训练和推理,首创六源循证范式。其在多场景评测中幻觉率低,多国医考成绩优异,已上线百小应APP并开放API。
Figure三代机器人发布:洗衣洗碗家务全包!网友:非人形没有出路了
Figure发布第三代人形机器人Figure 03,专为适配Helix AI系统、贴合家庭场景打造。家务表现出色,CEO称无遥控。该公司发展迅猛,融资超10亿美元。Figure 03内外全面升级,为规模化生产设计,引发网友对人形机器人前景热议。
DeepMind爆火论文:向量嵌入模型存在数学上限,Scaling laws放缓实锤?
DeepMind一篇关于向量嵌入局限性的论文在AlphaXiv爆火。其证明向量嵌入有数学上限,Scaling laws或放缓。研究构建LIMIT数据集,测试发现即便是先进嵌入模型也难解决简单任务,揭示了RAG系统约束,让人反思Scaling Laws边界。
AI已迷失方向?强化学习教父Sutton最新发布OaK架构,挑战当前AI范式,提出超级智能新构想
强化学习教父理查德·萨顿认为人工智能发展已迷失方向,提出OaK架构回应探寻真正智能的需求。该架构是基于模型的强化学习架构,具备组件持续学习等特点,为通用人工智能指明路径,但面临持续学习和特征生成挑战。
让AI创作不千篇一律,提示词随机插词汇就行
最新研究发现,在AI开写前由人类提供开头或随机插入词汇,写作效果会更多样,AI写作同质化或因“启动条件”问题。研究创建三类同质化评价指标,还发现向系统提示注入随机词汇可提升模型输出多样性。