「分组自注意力机制」共找到 985 篇相关文章
DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案
DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。
VGGT4D:无需训练,挖掘3D基础模型潜力,实现4D动态场景重建
香港科技大学(广州)与地平线研究团队提出 VGGT4D,无需训练,通过挖掘 Visual Geometry Transformer 注意力层运动线索,在动态物体分割等任务表现优异,为 4D 重建提供新思路。
Windows AI助手免费进化!能操作电脑、登录网页、生成代码
Windows Copilot正式更新,Microsoft 365 Copilot中Researcher智能体新增“计算机使用”能力,能操作电脑、登录网页、生成代码等。更新已在预览版上线,还介绍了其运行机制和性能测试情况。
深度拆解,硬核解构,揭开vLLM推理系统实现高效吞吐的秘籍
文章深度拆解 vLLM 推理系统,介绍其核心组件和高级特性,包括推理引擎流程、调度机制、高级功能等,还提及系统扩展、分布式部署、性能测量等内容,助力读者理解推理引擎工作原理。
浅谈上下文工程|从 Claude Code 、Manus 和 Kiro 看提示工程到上下文工程的转变
文章围绕上下文工程展开,介绍其概念、组成与提示工程区别,通过演示说明价值。还分析业界产品实践,如LangChain管理方法、Claude Code架构机制、Manus优化实践、Kiro开发模式,最后展望环境工程。
KTransformers入选计算机系统顶会、与主流框架合作,趋境&清华让「异构」成为推理新范式
KTransformers由趋境科技与清华团队联合研发,是高性能异构推理框架。其论文入选SOSP 2025,还与SGLang合作。它有算子优化等创新,能让CPU与GPU协同,推动推理架构融合,已成广泛复用的底层框架。
13万被引!ImageNet作者苏昊或将加盟复旦
近期,「UCSD副教授苏昊将加盟复旦」传言不断,但尚无权威公开信息证实。苏昊是ImageNet早期参与者,科研成果丰硕,论文被引达13.3万。若加盟,或为复旦带来多方面提升,但也面临诸多挑战。
国产开源大模型:再见9月,你好10月~
9月国产大模型持续开源,涉及DeepSeek、Qwen、百度等。如DeepSeek-V3.1缓解语言问题、优化Agent能力;阿里Qwen系列开源超10个模型;百度Qianfan-VL增强领域能力等。还展望10月新模型开源。
不等风来,要做风的源头:海淀孵化器新政以“场域孵化”催生创新范式跃迁 | 甲子光年
在全球经济与科技变革背景下,孵化器正经历范式重塑。海淀出台《海淀区高质量孵化器政策》,构建“创新策源场”,通过“源头激活”“垂直深耕”“生态协同”引领行业升级,助力创新发展。
Rust 天花板级大神公开发帖找工作:3000 次核心提交,不敌 “会调 OpenAI API、用 Cursor”?
Rust 编译器核心贡献者 Nicholas Nethercote 和 Michael Goulet 因团队缩编等原因公开找工作。Nicholas 称 AI 吸走大量资金与注意力,使 Rust 项目资源减少。同时,Unix 联合创始人质疑 Rust 能否取代 C。