「DeepSeek-V3.1」共找到 3735 篇相关文章
Google研究发现:Multi-Agent的核心竟然是Prompt设计!
Google和剑桥大学研究多智能体系统,发现提示设计影响大,有效拓扑结构占比小。提出Mass框架分三阶段优化,实验用Gemini 1.5 Pro和Flash模型,对比多种方法,在多任务上性能显著提升。
刚刚2岁的Llama,「爸妈」都跑了!小扎手拆Meta AI,LeCun保持独立
面对谷歌、OpenAI等劲敌及Llama 4翻车、人才流失困境,小扎决定重组Meta GenAI团队,设三大架构。2023年Llama首版论文14名作者只剩3人,Llama 4也问题不断,而LeCun坚持自己的路线。
参数量暴降,精度反升!哈工大宾大联手打造点云分析新SOTA
哈工大(深圳)和宾大联合团队推出基于KANs的3D感知解决方案PointKAN,能处理点云数据下游任务。它替代MLP,有更强学习几何特征能力。还提出PointKAN - elite,降参保量。实验表现出色。
预训练Token消耗直接腰斩!上海AI Lab&上交大提出全新预训练任务,开源首个8.9B隐空间大模型NCP-ArchPreview
本文介绍上海AI Lab与上海交大团队联合提出全新预训练任务NCP,打破传统逐词预测教条,开源全球首个8.9B规模离散隐空间基座大模型,预训练Token消耗仅需一半,收敛速度提升近一倍,下游性能显著提升,公开全部训练资产供全球研究使用。
大模型开网店,谁是经营高手?E-Commerce Bench开源揭秘
为评估模型长程经营能力,联合淘天集团发布E-Commerce Bench,以10万本金、365天经营网店来评测。从多维度评估18个模型,结果差异大,还发现单一指标会掩盖模型表现,评估基准潜力大。
15岁进少年班,97后打造「元点机器人宇宙」:全栈技术自研领跑家庭机器人赛道
元点Zeroth发布全尺寸人形Jupiter和异构机械臂家庭协作机器人N1,强调与人类长期共生关系。其创始人是97年的郭人杰,公司已累计融10亿。元点有全栈技术体系,走渐进式落地路线。
Loop世界模型论文登顶Hugging Face,来自中国一家初创,周鸿祎陆奇都投了
Prompt还没退场,Loop已开始接管AI叙事。Loop Engineering突然爆火,而Looped World Models(循环世界模型)技术含金量更高,其论文登上Hugging Face Papers当日Top1。该论文由中国初创公司脸谱心智完成,成果显著。
当 Token 成为商品,AI 基础设施会怎么变化?
在大模型时代,智能生产和交付未实现工业化,存在性能鸿沟。九章云极提出AI工厂战略,发布Alaya NeW Cloud 3.0,将从资源计量转向智能计量,打造训练和Token工厂,提升算力到有效Token的转化效率。
AI四小龙,估值破万亿
中国AI四小龙估值破万亿,DeepSeek、智谱、MiniMax、月之暗面各有不同定价逻辑。它们估值暴涨受技术、港股窗口、国家大基金入场等因素影响。当下,它们面临算力和场景问题,未来发展各有挑战。
The Batch: 954 | Kimi K2.6 挑战开源权重模型领先者
Moonshot AI升级后的Kimi K2.6是1万亿参数的视觉 - 语言模型,专为代码生成设计,性能与Qwen3.6 Max Preview等相当,略逊顶级闭源模型。其功能多,幻觉率低,模型权重可免费下载。