「推理时扩展」共找到 2933 篇相关文章
不卷速度卷验证,陈天桥MiroMind精准预测15天后黄金价格
陈天桥带队的MiroMind发布新一代重型推理智能体MiroThinker-1.7和MiroThinker-H1,在基准测试中表现优异,超越众多顶尖模型。该模型不仅通用任务强,在科技金融等专业领域也表现亮眼,还能承担真实长链条智力任务。
马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1
当谷歌Gemini 3将上线消息传得沸沸扬扬时,马斯克xAI更快一步上线最新大模型Grok 4.1,响应速率提升、幻觉率下降。它有两个“形态”,免费开放且有APP版。在LMArena测试中成绩亮眼,多方面能力提升。
NVIDIA港大MIT联合推出Fast-dLLM v2:端到端吞吐量提升2.5倍
自回归大语言模型推理效率受限,Fast - dLLM v2 由 NVIDIA、港大、MIT 联合推出。它将预训练 AR 模型适配为能并行解码的 Block - dLLM,用约 1B tokens 微调,端到端吞吐量最高提升 2.5 倍,精度相当。
医疗幻觉率比DeepSeek低3倍,百川循证增强大模型横扫全球医学考试!
百川智能发布首个循证增强医疗大模型Baichuan - M2 Plus,将循证医学理念融入训练和推理,首创六源循证范式。其在多场景评测中幻觉率低,多国医考成绩优异,已上线百小应APP并开放API。
斯坦福&SambaNova联手发布ACE框架:上下文即战力
文章介绍了斯坦福与SambaNova联手发布的ACE框架。它解决传统提示工程缺陷,将提示工程升级为智能体自我演化体系。通过“生成 - 反思 - 策展”闭环,实现上下文低成本、低延迟、高扩展演化,小模型搭配它能击败大模型+传统提示。
实证:现在的LLM根本不会Reasoning!
论文指出当前大推理模型(LRM)如DeepSeek - R1等可能只是在表演“思考秀”,遇到复杂问题就崩溃。研究者用4个可控谜题测试,有三大颠覆发现,还揭示思考过程的荒诞现象,直指行业痛点并给出发展方向。
清华推出AI数学家!独立完成数学理论难题,自动调用基本定理、构建证明思路
清华团队推出AI Mathematician(AIM)框架,可将LRMs推理能力延伸至前沿数学研究。它由三大模块驱动,有两大核心策略。实验显示其能解决多个挑战性问题,虽有不足,但未来有望成数学研究核心驱动力。
新DeepSeek R1代码能力直逼Claude 4!附生成任何优质网站的通用提示词
作者体验DeepSeek R1超8小时,发现其文本写作问题大幅修复,思维链推理改进,代码能力提升,前端审美直逼Claude 4。文章展示其前端能力,给出写前端网页提示词及设计逻辑,还探讨了其在复杂任务中的表现。
首次披露!DeepSeek V3 发布软硬一体协同训练论文,公开「降成本」秘诀
DeepSeek团队发布论文《洞察DeepSeek - V3:规模的挑战和对AI架构硬件的思考》,从硬件架构和模型设计双重视角,探索其经济高效的大规模训练和推理方法,介绍了设计原则、低精度驱动等多方面内容及降成本秘诀。
小扎不死心Manus“自研”了一个,但模型用的Claude……
Meta推出智能体平台Hatch,功能类似Manus,开发阶段用Claude,计划正式上线时切换到自研模型Muse Spark,10月推出新模型Watermelon。Hatch注重消费数字生活,与Meta社交生态深度绑定,高端订阅有默认分发优势,但面临真实环境考验。