Java 25」共找到 170 篇相关文章

算法论文8

马斯克惊叹!DeepSeek和Kimi先后出手,捅破了Transformer的「潜规则」!

文章介绍了DeepSeek和Kimi在残差连接上的突破。DeepSeek让连接权重可学习,用数学约束保证稳定性;Kimi将注意力机制用于层间连接,解决了更根本的问题,性能提升显著。

花叔
新闻资讯7

机器人新势力估值断层加速,具身智能靠什么穿越风暴?

文章指出机器人新势力估值断层加速,具身智能公司估值复杂,标准难统一。其智能路线收敛,但暂无领先团队。投资上,虽人才被认为处‘价值低谷’,但 VC 要回归商业本质,港股上市规则也引发担忧。

AI科技评论
新闻资讯8

估值315亿!田渊栋AI创业,谷歌、英伟达和AMD参投

Meta离职的田渊栋官宣创业,成立RSI,获6.5亿美元融资,估值约316亿。8位联创阵容豪华,团队致力于构建开放式架构,让智能体自主学习升级,目标打造具5万博士能力的智能系统。

AIGC开放社区
新闻资讯7

一场关乎纯度99.9999%的国运之战

2026年,一场围绕电子特种气体纯度的“国运之战”正激烈展开。其纯度要求已严苛至6N乃至更高,这关乎国家科技自立、产业安全。当前中国电子特气市场虽扩大,但本土产业面临外资封锁,国产化突围道阻且长。

芯师爷
算法论文8

警告:你的Agent可能无法"解决"真实世界的视觉问题

文章提出 AgentVista 评测基准,含 209 道任务,横跨 7 大领域 25 个子方向。评测 14 个主流模型,最强的 Gemini - 3 - Pro 准确率仅 27.27%,揭示多模态 Agent 在视觉理解、工具调用等方面挑战大。

深度学习自然语言处理
开源动态8

DeepSeek深夜炸场,开源了一个新项目&论文,V4打前站?

凌晨,DeepSeek开源新项目Engram并公开论文。Engram用可扩展的O(1) N - gram记忆替Transformer早期层节省算力,在多方面实验表现出色,如推理任务增幅大于知识任务,还分析了其机理和系统效率。

PaperAgent
算法论文7

直播预约 | 强化学习训练能否不依赖外部知识优化模型的弱点?

论文提出 SwS 框架,针对强化学习场景,利用模型自我感知弱点驱动自动化问题生成,合成针对性训练数据。还对其进行多项扩展,在多个基准测试集和模型上验证有效,性能提升显著。

深度学习自然语言处理
开源动态8

从多模态大模型中「拆」出音频向量模型

Google 发布原生多模态向量模型 Gemini Embedding 2,推动 Omni Embedding 发展。Jina AI 团队分享从多模态大模型中「拆」出音频向量模型的经验,介绍架构、训练数据,对比四种做法,还提及评测、应用场景及结论。

Jina AI
新闻资讯7

The Batch: 906 | AI 巨头分担维基百科的成本

维基百科成立25周年,维基媒体基金会与Amazon、Meta等多家AI公司达成合作,推出Wikimedia Enterprise计划,允许合作方高速大规模访问数据。维基百科需资金支持,AI公司也需其数据训练模型。

DeeplearningAI
新闻资讯8

收官|近50万人次参与!首届北京艺术与科技周“热力值”拉满

12月7日,首届北京艺术与科技周在798艺术区收官。活动联合16+家机构,邀100+嘉宾,有100+场展演对话,近50万人参与。科技领袖对话、艺术先锋云集,还有多项原创首发,引25+家媒体关注。

798艺术区