训推不一致性」共找到 653 篇相关文章

算法论文8

谷歌DeepMind「粪坑淘金」全新方法,暗网毒数据也能出善良模型

谷歌DeepMind研究团队发表论文提出生成式数据精炼(GDR)方法,不直接生成新数据,而是用大模型净化原始数据,保留有用信息。该方法能解决数据枯竭、隐私等问题,实验显示效果良好。

新智元
新闻资讯7

个人开发者400亿参数大模型:分布式算力,DeepSeek架构,3090单卡部署

Nous Research出Psyche Network,可整合全球算力练AI。它基于Deepseek的V3 MLA架构,有DisTrO优化器等技术,能让个人和小团体创建大规模模型,还实现40B参数LLM预练。

量子位
开源动态8

不用人类手写练框架了!AI自己写代码,出1B端侧「小钢炮」

5月25日,面壁开源端侧文本基座大模型MiniCPM5 - 1B,主打低成本部署等。它由AI编写的ForgeTrain框架参与预练,效果与英伟达Megatron对齐且速度快10%。该模型在榜单表现优,应用边界广,部署门槛低。

机器之心
算法论文7

ICLR 2026 | 越越快! 首个面向「Test-Time Scaling」的投机解码基准

文章指出理阶段扩展(TTS)能提升理大模型解决复杂问题的能力,但会产生大量冗余计算。为此提出首个面向TTS的投机解码加速综合基准,评测显示N - gram方法在特定场景加速潜力大,混合策略性能更优。

AI科技评论
8

ChatGPT新功能Pulse,GPT-5主动给你消息,大家玩得停不下来

本周五凌晨,OpenAI 向 Pro 订阅用户开放 ChatGPT 新功能「Pulse」预览版。它基于智能体,会根据用户信息提供个性化更新,还能异步搜索。用户可管理研究内容、提搜索请求及反馈,未来或广告、建社交网络。

机器之心
算法论文8

DPad: 扩散大语言模型的中庸之道,杜克大学陈怡然团队免理加速61倍

扩散大语言模型(dLLMs)有全局规划能力,但存在计算冗余。杜克大学陈怡然团队揭示其“草稿纸机制”,提出免练方法DPad,结合现有技术,能在几乎无损精度下实现高达61.4倍理加速。

机器之心
算法论文8

黎曼猜想至理论边界99.55%!元代理架构AI:在思考中重塑大脑

科学家面临让AI解决复杂科学难题的问题,传统固定架构AI处理特定复杂问题不顺手。近日学术团队提出Eureka架构,能让AI动态“生长”专用“大脑”,在测试中表现出色,还在数学和物理领域有重大成果。

新智元
新闻资讯8

澳洲放羊大叔引爆AI编程革命!Claude Code急goal模式,不干完不许停

澳洲牧羊大叔用三行bash解决AI编程‘把事做完’难题,11天内被OpenAI、Anthropic和Hermes收编。Claude Code出/goal功能,各公司实现路径不同,争的是工作流入口。

新智元
8

谷歌全新Gemini Omni首曝,视频版「香蕉」来了!教授黑板公式全对

谷歌原生视频模型Gemini Omni意外曝光,其生成视频的连贯性、一致性惊艳,还能实现实时编辑。此前OpenAI的Sora App停服,谷歌I/O 2026将开幕,多款Gemini模型或亮相。

新智元
产品应用8

设计行业天塌了!Anthropic再王炸产品Claude Design:设计稿、原型、PPT一句话搞定

Anthropic出平台级产品Claude Design,用Claude Opus 4.7模型助力设计。它能让各类用户完成视觉内容创作,有多种使用场景和便捷工作流程,还给出内部设计师使用建议。

AI寒武纪