协同测试」共找到 2082 篇相关文章

算法论文7

The Batch: 845 | 没有理由的“推理”

研究人员给LLM输入多项选择题,故意提供误导性提示。用MMLU和GPQA测试Claude 3.7 Sonnet和DeepSeek - R1,发现模型常被提示误导,但其‘思维链’往往未提及提示,表明‘思维链’不足以解释推理过程。

DeeplearningAI
开源动态8

MetaShuffling:Meta的Fused MoE kernel工程方案,更激进的Kernel优化和尽量避免Padding

文章介绍Meta的Fused MoE kernel工程方案MetaShuffling,可高效部署Llama 4模型。它处理MoE推理挑战,介绍多种token选择路由方案,阐述运行时设计、不同并行化方式及优化思路,还展示性能测试与Trace分析。

GiantPandaLLM
算法论文8

ICLR 2025 Oral | LLM也有从众心理!

浙江大学团队论文指出,多AI协作系统存在“群体思维”,多个AI共同决策时会盲目跟多数意见。研究者开发BenchForm测试平台验证LLM从众行为,还分析原因、给出让LLM更独立的方法,指出从众利弊及未来挑战。

深度学习自然语言处理
新闻资讯8

CSDI峰会开启:Agentic AI 落地应用的黄金期,智能系统重塑生产力

2026年AI从大模型迈向智能体,技术底座爬坡,应用层将爆发。Agentic AI降低构建门槛,行业渗透惊人,未来智能体将重塑生产力,竞争焦点转向生态协同。2026 CSDI峰会10月16 - 18日在深圳召开,共探其应用。

AIGC开放社区
新闻资讯7

AI公司最赚钱的生意,还是卖广告

2026年Q1财报显示,AI浪潮下广告仍是最赚钱业务。Meta的AI广告工具年化营收超600亿美元,超过OpenAI和Anthropic收入之和。广告变现路径短,AI放大其效率,OpenAI也开始测试广告。

DeepTech深科技
开源动态8

SGLang Hierarchical Sparse Attention 技术深度解析

阿里云等团队推出面向 Sparse Attention 的分层稀疏化框架,介绍其架构、机制与实践。此框架破解了长上下文推理时的计算与容量瓶颈,以 DeepSeek DSA 集成测试,使推理性能大幅提升,目前项目处于开发阶段。

阿里云开发者
新闻资讯7

谷歌推出 Jules:一款基于 Gemini 2.5 的异步编程智能体

谷歌将异步智能编程助手 Jules 正式发布,它基于 Gemini 2.5 Pro 模型,可执行多种编程活动。采用异步模式,直接接入代码库。测试阶段开发者反馈多,正式版有三种访问层级,但部分用户对其界面和输出质量不满。

InfoQ
算法论文8

英伟达、港大等发布创新KV缓存,实现扩散模型无训练加速

多数开源扩散语言模型推理效率不如自回归模型,英伟达、港大、麻省理工研究人员联合提出Fast - dLLM。它用近似KV缓存机制减少冗余计算,还提出基于置信度的平行解码策略,测试显示能加速且保持生成质量。

AIGC开放社区
新闻资讯7

刚刚,LMArena最新模型榜单出炉!DeepSeek-R1网页编程能力赶超了Claude Opus 4

LMArena最新模型榜单出炉,DeepSeek - R1(0528)表现亮眼。在文本基准测试中整体排第6、开放模型中排第一,细分领域也成绩优异,在WebDev Arena平台与闭源大模型并列第一,超Claude Opus 4。

机器之心
新闻资讯8

Qwen3.8-Max 正式版终于发布了,能不能打过 GPT 看这里

Qwen 3.8 Max 正式发布,沿用 Qwen 3.5 架构,参数量扩展,重点提升 Coding、Work 和 Agent 能力。它将开放权重,价格有优势。在多项测试中表现出色,还新增多模态能力,已可使用并有优惠。

MacTalk