多语言推理」共找到 6081 篇相关文章

算法论文8

突触神经元模型问世,国内团队打造类脑计算新引擎,登上《自然·通讯》

当前人工智能高能耗问题凸显,脉冲神经网络被认为更具生物合理性、能效更高,但缺乏平衡计算效率和生物合理性的脉冲神经元模型。国防科技大学与中科院团队合作提出 MSF 脉冲神经元模型,相关研究发表于《自然・通讯》。

机器之心
开源动态7

隐藏超上下文工程(Context Engineering)技巧的框架,来试一试吧!

文章指出数人构建的AI Agent像Shallow Agent,处理复杂任务能力弱。以Claude Code等为例,介绍深度Agent架构的秘密,如冗长提示词、规划工具等,还推出开源包deepagents方便上手。

CourseAI
新闻资讯7

并行革命,32倍吞吐量跃升!英伟达Helix架构突破百万Token推理瓶颈

英伟达推出受DNA结构启发的Helix并行技术,能解决大模型处理长任务时的卡顿问题,提升上下文长度、并发能力并降低响应延迟。不过也有人认为其技术与实用性有差距。

新智元
开源动态8

最强3B「小钢炮」,代码数据全公开!推理随意开关,128k超长上下文

Hugging Face推出30亿参数模型SmolLM3,支持128k长上下文,训练等全链路开放。它在架构、数据混合策略等方面优化,性能超Llama3.2 - 3B等,还公开双模式指令模型构建方案。

新智元
算法论文8

华为CloudMatrix重磅论文披露AI数据中心新范式,推理效率超NV H100

华为发布60页重磅论文,提出下一代AI数据中心架构Huawei CloudMatrix及产品CloudMatrix384。它架构设计独特,性能高效准确灵活,打破算力、延迟和成本“不可能三角”,重新定义AI基础设施。

量子位
新闻资讯7

Meta 再挖角4名OpenAI 华人研究员!网友:希望给的钱不要比Yann LeCun ……

The Information报道,Meta再从OpenAI挖走四名关键华人研究员,这是第二波挖角。此前Meta刚斥巨资收购股份并挖来华裔CEO。此次挖角引发各方反应,也凸显AI人才竞争激烈。

AGI Hunt
开源动态8

阿里智能体推理超越GPT-4o,开源模型也能做Deep Research

通义实验室推出自主信息检索智能体WebDancer,其通过系统化训练范式为构建智能体提供路径,也为在开源模型上复现Deep Research系统提供指导。它在数据集测试中表现出色,团队还对其未来应用做了展望。

量子位
推荐文章7

一文讲透程序编排的核心方式:从表达式语言到并行化实践

文章围绕程序编排展开,介绍单语句编排、类编排、流程编排、并行化编排等核心方式,分析种编排框架特点及适用场景,还提及Lindorm泛时序数据解决方案,为开发者提供编排参考。

阿里云开发者
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。

深度学习自然语言处理
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用旋转位置编码 (RoPE) 的现代Transformer模型中,注意力机制的查询 (Q) 和键 (K) 表示存在集中极大值,而值 (V) 表示无此模式。研究通过实验揭示其与上下文知识理解的关键联系。

机器之心