「Attention性能瓶颈」共找到 2434 篇相关文章
港科提出新算法革新大模型推理范式:随机策略估值竟成LLM数学推理「神操作」
香港科技大学联合团队提出 ROVER 算法,跳过传统强化学习推理的策略迭代循环。它在多项数学推理基准上超越现有方法,在高难度任务中大幅提高 pass@1 和 pass@256,且提升推理多样性,更轻量。
大模型优秀大脑齐聚硬核开源聚会,SGLang社区举办国内首次Meetup
10月25日,SGLang联合美团、亚马逊云科技在北京举办国内首场Meetup。SGLang是开源高性能推理引擎,特性丰富。活动中大咖和开发者分享见解、进展、应用场景,展现其社区活力与发展潜能。
TPAMI 2025 | AI对抗迁移性评估的「拨乱反正」:那些年效果虚高的攻防算法们
本文第一作者赵正宇来自西安交大,针对现有迁移攻击方法缺乏系统公平对比分析的问题,将其分为五大类,在 ImageNet 上对 23 种攻击与 11 种防御方法开展评估,证实评估缺陷会误导结论,解决后有新见解。
清华联手快手可灵,撞车谢赛宁团队RAE,用SVG再证明VAE已过时
AI图像生成正告别VAE技术。清华与快手可灵联合提出SVG方案绕开VAE,纽约大学谢赛宁团队也提出RAE模型。SVG用自监督特征构建潜空间,在质量、效率和通用性上超传统,证明统一视觉模型可行。
清华联手英伟达打造扩散模型新蒸馏范式!视频生成提速50倍,4步出片不穿模
清华大学朱军教授团队与NVIDIA Deep Imagination研究组联合提出分数正则化连续时间一致性模型(rCM),将连续时间一致性蒸馏扩展至大模型,解决现有方法瓶颈,提升推理速度兼顾质量与多样性。
AI模型守法率提升11%,港科大首次用法案构建安全benchmark
香港科技大学KnowComp实验室从法律合规视角研究LLM安全,提出「安全合规」新范式。基于法律条文构建benchmark,用GRPO微调Qwen3 - 8B得推理模型,在新benchmark测试中性能提升显著。
1.58bit不输FP16!微软推出全新模型蒸馏框架,作者全是华人
微软推出蒸馏框架BitNet Distillation,实现几乎无性能损失的模型量化。它含三阶段,经实验在多下游任务表现近全精度模型,降内存开销、提推理速度,作者全是微软研究院华人。
谷歌 Java 代理开发工具包新增 LangChain4j 集成
谷歌 Java 代理开发工具包(ADK)0.2.0 版本集成了 LangChain4j,显著扩展功能,让开发者能使用更多模型。谷歌开发者 Guillaume Laforge 解释其优势,ADK 还引入系列增强提升性能。
NeurIPS 2025 Spotlight | PhysX-3D:面向真实物理世界的3D资产生成范式
论文由南洋理工大学 - 商汤联合研究中心 S - Lab 及上海人工智能实验室合作完成,提出首个系统性标注的物理基础 3D 数据集 PhysXNet 及扩展版 PhysXNet - XL,还提出 3D 生成框架 PhysXGen,实现从图像到真实 3D 资产的生成。
新版 Android 插件登场,应用能瘦身 50%,Google 把代码优化和资源压缩合二为一
Google在新版Android Gradle Plugin引入资源压缩优化方案,合并代码优化与资源压缩。新方案让应用体积最高缩减50%,开发者有四种优化方式可选,AGP 8.12.0已提供该流程,AGP 9将默认开启。