推理算法优化」共找到 3354 篇相关文章

新闻资讯7

“别急着裁底层,很多高管才最该被 AI 接管?”

文章围绕AI在企业中的应用展开,探讨AI预算分配、build vs buy、岗位替代等问题。指出AI预算将按人分配,建东西变便宜但有瓶颈,高层瓶颈更适合先被AI优化,代码审查或成高风险环节。

AI科技大本营
推荐文章7

【博客转载】CUDA Local Memory

文章围绕CUDA本地内存展开,介绍其为线程私有存储空间,访问特性与全局内存类似。通过两个计算滑动平均值的CUDA kernel示例,展示数组索引复杂度对存储位置的影响,还给出判断存储位置的方法及优化建议。

GiantPandaLLM
算法论文8

首创Mid-training范式破解RL奥秘,Llama终于追平Qwen!

上海创智学院和上海交通大学研究团队深入探讨不同基础语言模型在强化学习训练中的差异,提出中期训练策略,将 Llama 改造成适配 RL 的推理基础模型,缩小与 Qwen 性能差距,还发布了 MegaMath-Web-Pro-Max 数据集。

机器之心
算法论文8

CVPR 2026 | 从视觉Token内在变化量出发,实现VLM无损加速1.87倍

随着高分辨率图像与长视频处理需求增长,大型视觉语言模型推理效率成瓶颈。V²Drop从视觉Token内在变化量出发,采用多阶段渐进式剪枝策略,实现无损加速,在图像和视频理解场景表现卓越。

机器之心
产品应用8

获NVIDIA致谢:悟空Agent的实践、复盘与迭代

本文以悟空Agent获NVIDIA致谢为切入点,介绍多智能体架构闭环及实战挑战,如上下文断流、调度失衡。还阐述架构设计、迭代优化、数据飞轮体系,指出AI infra存在安全隐患,强调安全融入业务的重要性。

腾讯技术工程
技术文章8

加一个JVM参数,让系统可用率从95%提高到99.995%

文章针对高并发系统不稳定问题,定位是系统内存索引切换时 GC 压力大所致。围绕让索引尽早晋升、直接分配到老年代等思路探索优化,经多番尝试,最终实现索引无感切换,使系统可用率达 99.995%。

阿里云开发者
产品应用8

小模型,大能量!200美金的GPT Pro竟然输给了它?

博主用11个场景深度测试昆仑万维的Skywork R1V4 - Lite,它能做到Gemini 2.5 Pro才能干的事,速度快、成本低。在定位、人物识别、生活实用、专业鉴定、学术研究等场景表现出色,核心突破在于主动图像操作与深度推理

AI产品黄叔
产品应用7

吃灰 AI 眼镜爆改“交警 Copilot”,函数计算AgentRun 实操记录

作者将吃灰的Meta Ray - ban眼镜爆改成“交警Copilot”,介绍了“端 - 管 - 云”协同框架,分享客户端与服务端开发过程。还探讨用Agent架构和FaaS的原因,指出其在应对需求变化、节省成本等方面优势,最后提及项目待优化处。

阿里云开发者
新闻资讯7

田渊栋被裁后新offer排到法国!原来Llama 4.5训完后被卸磨杀驴了

Meta此次裁员引发诸多争议,工作超十年的田渊栋整组被裁。有说法称是因没做出基于Llama 3的推理模型,但田渊栋否认。Llama 4.5训练好后团队被裁,且后续还将裁风控部门。不过田渊栋获多家公司青睐。

量子位
算法论文8

EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!

近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。

深度学习自然语言处理