开发团队」共找到 4741 篇相关文章

开源动态8

DeepSeek-R1-0528 打榜、20+案例全面实测,全球网友狂点赞:实力堪称R2!

DeepSeek 上新的 DeepSeek - R1 - 0528 让 AI 圈沸腾。它在 LiveCodeBench 榜单飙升至第 4 位,性能逼近 OpenAI 的 o3 高级版。全球网友实测后好评如潮,其在多方面能力出色,且完全开源,引发对 R2 的期待。

AGI Hunt
算法论文8

ICML 2025 Spotlight | 多模态大模型暴露短板?EMMA基准深度揭秘多模态推理能力

最新研究推出 EMMA 基准测试,揭示顶尖多模态大语言模型在深度视觉与文本融合的复杂多模态推理上显著不足。该研究已被 ICML 2025 接收,代码数据开源。实验表明,现有模型与人类专家差距大,视觉推理是核心瓶颈。

机器之心
算法论文8

刚刚,DeepSeek首曝V3降成本秘诀!软硬协同突破Scaling天花板

DeepSeek最新论文从硬件架构和模型设计双重视角,探讨如何相互配合实现低成本大规模训练和推理,分析硬件特性对架构选择的影响,研究两者相互依赖关系,还为未来协同设计提出建议。

新智元
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。

深度学习自然语言处理
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用旋转位置编码 (RoPE) 的现代Transformer模型中,注意力机制的查询 (Q) 和键 (K) 表示存在集中极大值,而值 (V) 表示无此模式。研究通过实验揭示其与上下文知识理解的关键联系。

机器之心
算法论文9

给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

针对原生视觉推理缺少完整训练评估基础设施的现状,NTU等多校联合推出VBVR-Pro系统,构建了从任务构建、模型训练、能力评测到强化学习优化的完整闭环,论文、数据、代码均已公开。

机器之心
推荐文章9

本地该怎么做RSI?我们与StartLux CTO聊了聊

菲尔兹奖得主联名信引发AI数学研究争议,前沿研究开始防备云端AI,但本地AI能力不足。本文专访StartLux CTO郭权玮,深度讨论本地RSI实践路径,披露Auto Research方法、实验数据与安全方案,介绍本地模型研发进展。

机器之心
算法论文7

The Batch: 979 | LLM 清理智能体的“垃圾”

研究人员提出选择性管理智能体记忆之法,小红书Xubin Hao等构建Self - GC。它在送上下文给LLM前,让大语言模型决定内容取舍。测试显示其删历史少且保留必要细节能力强,不过未测其输出质量。

DeeplearningAI
新闻资讯8

陈大年复出,入局大模型

国产大模型领域黑马StartLux-V1.0-27B-Preview,参数量仅27B,在信通院MCP测试中排综合第二,仅次于1.6万亿参数量的DeepSeek-V4-Pro。其创始人陈大年押注本地模型,公司专注该领域商业化。

量子位
新闻资讯8

李飞飞首个多模态世界模型 Atlas 正式发布:从零开始预训练,几张图就能构建世界

李飞飞创办的 World Labs 发布多模态世界模型 Atlas,可原生处理多类型数据,有世界生成、重建和模拟等能力。还介绍其研发历程、技术特点,以及 World Labs 收购、融资等情况。

InfoQ