超连接」共找到 2240 篇相关文章

开源动态8

Qwen紧追OpenAI开源4B端侧大模型,AIME25得分越Claude 4 Opus

Qwen团队深夜开源两个端侧模型Qwen3 - 4B - Instruct - 2507和Qwen3 - 4B - Thinking - 2507,尺寸对端侧友好,支持256k上下文。后者在AIME25测评得分Claude 4 Opus,两模型能力较前作均有提升。

量子位
开源动态8

本地Opus你要不要!Qwen3.8-27B开源

阿里Qwen团队开源Qwen3.8-27B,上线2天登顶Hugging Face全球大模型趋势榜,下载破百万。其性能Opus4.6,与顶尖模型相当,量化后普通电脑就能跑,原生多模态,编程、Agent、多模态跑分表现出色。

AIGC开放社区
开源动态7

OpenAI突然开源新模型!99.9%的权重是0,新稀疏性方法代替MoE

OpenAI悄悄开源新模型,0.4B参数且99.9%权重为零,是Circuit Sparsity技术的开源实现。该技术通过约束模型内部连接稀疏性,解决传统稠密Transformer黑箱问题,或让MoE模型走上末路,但目前算力成本极高。

量子位
产品应用8

英伟达帮你省钱,让大模型推理「短而精」,速度快5倍

过去大模型推理追求长链思维,导致推理链长、Token消耗大、响应慢。英伟达研究院的DLER研究给出解决办法,通过强化学习优化方法让模型‘短而精’,推理长度减70%且准确率不变,还适用于大模型。

机器之心
推荐文章7

6个做AI和ML的奇技淫巧

作者整理了6个做AI和ML的技巧,如提前结束评估、参数过度优化、精心挑选数据集等,指出现在90%的模型可能都用到其中不止一招,还介绍了自己用AI采集资讯发布到知识星球。

AGI Hunt
产品应用7

Cursor发布Composer 2:专攻代码的模型,价格只有GPT-5的零头

Cursor本周发布自研编程模型Composer 2,只攻代码生成。其得分提升,Claude Opus 4.6,接近GPT - 5.4 Thinking。训练基于代码数据,处理复杂编程任务准确度高,价格远低于竞品。这是Cursor全栈布局,欲掌握AI编程主动权。

AI工程化
新闻资讯7

龙虾社交上线40天被Facebook收购!俩文科创始人加入级智能实验室

刚上线40天的AI Agent社交网站Moltbook被Meta收购,两位文科创始人将加入Meta级智能实验室。Moltbook因人类冒充AI的假帖子爆火,但安全漏洞明显。Meta看中其让AI智能体在线连接的能力,或优先修复安全问题。

量子位
开源动态8

王兴一鸣惊人!美团首个开源大模型追平DeepSeek-V3.1

美团首个开源大模型Longcat-Flash-Chat发布即引发热议。它在部分benchmark上DeepSeek-V3.1等,编程能力也出色。技术报告透露美团对大模型的理解,还有新发现,且性能好、训练效率高。

量子位
算法论文7

生成式推理再排序,可能会是LLM4RecSys的新突破口吗?

Meta AI研究者尝试把推理模型引入推荐系统再排序阶段。论文通过监督微调等赋予模型推理能力,LLM4Recsys标杆。中期内化物品语意ID,生成推理路径,推理赋能再排序,披露重排序提升空间。

机器之心
开源动态8

AGI 新技术路线:下一代稀疏注意力机制 Monte Carlo Attention 开源

对称技术公司在新版基座模型 BigBang - Proton 中使用的 Monte Carlo 注意力开源。它基于二进制块编码技术,用块间代表交流机制实现线性复杂度,兼具多种注意力机制优点,可满足宇宙尺度建模的上下文长度需求。

AI科技大本营