通用推理技术」共找到 4999 篇相关文章

开源动态7

非Transformer架构的新突破,液态神经网络的推理小模型只用900M内存

谷歌提出的Transformer架构基本垄断大模型,而初创公司Liquid AI研发的液态神经网络架构另辟蹊径。其发布并开源的LFM2.5 - 1.2B - Thinking模型,仅需900MB内存就能在端侧运行,性能优于Transformer架构模型,还降低了死循环生成比例。

机器之心
开源动态8

清库存!DeepSeek突然补全R1技术报告,训练路径首次详细公开

DeepSeek给近一年前登上《Nature》封面的R1论文补64页技术细节,正文大幅翻修。新论文展开R1完整训练路径,补充R1 - Zero分析,还披露安全评估细节。此外团队稳定,引发对其后续动作猜测。

量子位
开源动态8

让OpenAI只领先5天,百川发布推理新模型,掀翻医疗垂域开源天花板

百川智能发布医疗推理大模型Baichuan - M2 - 32B,在OpenAI的Healthbench评测集上超越刚发布5天的gpt - oss - 120b,领先多数前沿模型,支持RTX4090单卡部署,还首创患者模拟器和Verifier系统。

量子位
新闻资讯8

奥特曼:ChatGPT只是意外,全能AI智能体才是真爱!Karpathy:7年前就想到了

当全球为ChatGPT喝彩,OpenAI的MathGen团队秘密锻造AI「推理」能力,打造全能AI智能体。OpenAI坚信推理能力可复制到各领域,未来AI智能体将颠覆一切,如今围绕人才的战争已白热化。

新智元
算法论文8

自适应Agent基础模型:从“会推理/会用工具”到“懂得取舍的执行者”

当前大型语言模型在智能体/工具调用场景有推理型和工具型两类,存在效率与功能、深度的矛盾。A²FM框架提出多模式自适应路由,实现模式自适应切换,在多基准测试中效果与效率双升。

深度学习自然语言处理
新闻资讯7

不跟英伟达走老路,这家GPU公司的技术架构藏着哪些关键解?

在国产GPU上市黄金窗口期,天数智芯上市后首场发布会引发广泛讨论。其公布架构路线图,2027年前追赶英伟达,之后转向创新架构设计。还提出回归计算本质、提供高质量算力两条架构判断,并展示边端算力产品及应用。

InfoQ
新闻资讯7

突发!微软与OpenAI同日开火:语音之战+通用大模型,AI霸权决战打响

OpenAI发布语音大模型时,微软同日推出自研语音模型MAI-Voice-1和通用模型MAI-1-preview。MAI-Voice-1效率高、表达丰富,MAI-1-preview采用MoE架构。微软此举在语音战场布局,也为与OpenAI谈判增加筹码。

新智元
开源动态8

MiniMax重磅开源M1模型:百万上下文超DeepSeek R1,实现性能与效率双杀

MiniMax正式开源首个推理模型M1,原生支持百万级上下文长度,在推理效率、计算成本和复杂任务能力上有独特表现。其在性能和效率上超越DeepSeek R1等模型,还提出创新强化学习算法。

AI科技大本营
算法论文8

跨越技术与法律的壁垒:AI赋能知识产权领域任务全能评测基准IPBench发布

本推文介绍arXiv论文《IPBench: Benchmarking the Knowledge of Large Language Models in Intellectual Property》。论文提出IPBench评估基准,构建含20个任务、10374个双语数据点的基准,评估17个主流模型,揭示现有模型在IP任务中局限。

深度学习自然语言处理
新闻资讯8

具身导航,感知推理到底是「上帝」,还是执行控制是「命门」?| GAIR Live 023

本文是GAIR Live 023圆桌对话实录,浙江大学彭思达与具身多模态算法专家郝孝帅探讨具身导航。涉及本质、范式、挑战、交互等方面,还对未来5 - 10年发展做了展望。

AI科技评论