新物质发现」共找到 4361 篇相关文章

开源动态8

Kimi开源线性注意力架构,首次超越全注意力模型,推理速度暴涨6倍

月之暗面发布开源Kimi Linear架构,用注意力机制首次超越全注意力模型。长上下文任务中,它减少75%的KV缓存需求,推理加速达6倍。核心创Kimi Delta Attention有细粒度遗忘门控等特点。

量子位
算法论文8

半在线RL范式UI-S1,使得GUI Agent既稳定又规划长远

现有AI训练方法在GUI自动化中各有弊端,本文提出半在线强化学习范式,训练出UI - S1 - 7B模型,性能提升显著,还提出评估指标SOP,是迈向实用化AI智能体的重要一步。

深度学习自然语言处理
算法论文7

估值840亿AI实验室再放大招,他们要给大模型戴上「紧箍咒」

智元报道,OpenAI前CTO创办的Thinking Machines Lab发布研究「模块流形」,将传统数值修正转为「预防式」约束优化。它提出范式,为训练大模型提供思路,还介绍了流形优化器及相关算法。

新智元
算法论文8

大道至简,何恺明团队作pMF开启像素级「无潜、单步」生成范式

何恺明团队论文提出用于单步、无潜空间图像生成的pMF框架,直指主流扩散与流匹配模型通病。该框架将v、u和x三个场关联,训练网络把噪声输入直接映射为图像像素,实验表现强劲。

机器之心
开源动态8

如何实现可验证的Agentic Workflow?MermaidFlow开启安全、稳健的智能体流程范式

随着大语言模型发展,多智能体系统成前沿,「Agentic Workflow」受关注。但现有系统存在合理性难保证等问题。加坡和南洋理工团队推出MermaidFlow,以Mermaid语言显式建模工作流,提升可解释性与可控性,实验性能优秀。

机器之心
算法论文8

LoRA中到底有多少参数冗余?研究:砍掉95%都能保持高性能

这篇创研究介绍了LoRI技术,证明即使大幅减少LoRA的可训练参数,模型性能依然强劲。研究团队在多个任务上测试了LoRI,发现仅训练LoRA参数的5%,LoRI就能匹配或超越其他方法的性能。

机器之心
算法论文8

阿里+清华发现80/20法则:LLM只靠20%的token就能学会Reasoning

阿里与清华研究发现,训练大语言模型(LLM)推理时,真正关键的是20%的高熵token,其余80%低熵token几乎无用。仅用20%高熵token做强化学习,效果超全量训练,还提出RLVR训练策略提升效率。

深度学习自然语言处理
开源动态8

华人学生立大功!王Mamba-3直击Transformer死穴,推理效率碾压7倍

一代开源架构Mamba-3发布,由CMU普林斯顿原班人马打造,15亿参数性能比Transformer高4%,长序列任务端到端延迟仅为其七分之一。它采用设计哲学,推理优先,有三大核心技术,还能与自注意力层混合提升检索能力。

新智元
新闻资讯8

天终启,万象智生!从AlphaGo到GPT-5,智元十年见证ASI创世纪

2025年9月7日智元举办十周年峰会,主题为「天终启,万象智生」,汇聚多位重量级嘉宾探讨AI前沿突破。当下AI发展迅猛,大模型密集发布,如OpenAI的GPT - 5、谷歌的Gemini 2.5等,中国造大模型也在开源领域领先。

新智元
新闻资讯8

天终启,万象智生!从AlphaGo到GPT-5,智元十年见证ASI创世纪

2025年AI迈向ASI,智元迎十周年,9月7日将在北京举办峰会。众多大咖齐聚,探讨芯片、大模型等前沿突破。今年大模型发布密集,如OpenAI、谷歌等有成果,中国造大模型也表现出色,未来智能体等将爆发。

新智元