「低精度计算」共找到 1794 篇相关文章
GLM-5.2 正式发布:开源之王来了,摸到了Opus-4.8
GLM-5.2正式发布,主打长程任务能力,有1M token上下文窗口且完全开源。它在长程任务基准评测中表现出色,与顶级闭源模型差距缩小,还解决了超长上下文计算成本问题,同时应对了模型‘作弊’情况。
刚刚,国产Agent模型闯入全球第一梯队!限时免费
昆仑万维发布SkyClaw-v1.0及其轻量版SkyClaw-v1.0-lite Agent模型,性能达全球第一梯队,价格仅主流顶尖模型一半甚至更低,适配主流Agent框架,还兼容OpenAI接口,现限时免费,后续将逐步开源。
胜率直逼人类大师!这套Agent揭开中国AI「玄学真相」
在无信息泄漏的术数题库中,Claude、GPT等主流模型准确率低,而Tianfu Agent系统将准确率提至50%,逼近人类Top20选手。它采用多Sub - Agent协作等策略,还在工具管理、规则使用等方面有创新。
ICLR 2026 Oral|大模型总爱「想太多」? DECS从源头消除冗余思考,实现推理token减半且性能不降反升
以DeepSeek - R1等为代表的大型推理模型存在过度思考问题,造成大量冗余计算。复旦大学等团队在ICLR 2026 Oral论文中揭示‘长度惩罚’局限性,提出DECS框架,在多基准测试中实现推理长度减半且性能提升。
破解在线长时序重建难题!纯视觉、单卡实时的公里级流式3D重建|CVPR'26
在自动驾驶等领域,长序列3D重建落地难,存在精度退化等问题。即将到来的CVPR 2026中,LongStream模型开源,它重新设计,解决了长序列难题,在多基准测试表现强,推动3D视觉走向在线建模。
作业帮Flink On K8s落地实践
本文分享作业帮2025年Flink on k8s的探索与实践,包括选型思考、平台架构演进等关键内容。介绍了历史on Yarn模式的问题,阐述选型Flink K8s Operator模式的原因,还提及任务状态观测、环境资源成本等,分析核心问题并给出解决方案。
工业级 LLM 数据工程:北京大学 DCAI 团队 DataFlow 框架的架构设计与实践
2026 年大模型研发从‘模型中心’向‘数据中心’演进,数据语义密度与工程精度成突破关键。北京大学 DCAI 团队推出 DataFlow 框架,解决数据准备难题,其技术报告登顶 Hugging Face。该框架有多种特性,实验验证其能提升模型性能。
告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆
中国人民大学团队提出全新LLM记忆管理框架MemSifter,打破长时记忆管理‘精度不够’和‘成本太高’的困局。它将记忆检索‘外包’给轻量级代理模型,采用任务结果导向的RL训练范式,在8个基准测试中超越现有SOTA方案。
视频生成太慢?英伟达、谢赛宁等发布TMD框架,实现70倍加速
大规模视频扩散模型采样效率低,应用受限。英伟达联合谢赛宁等提出TMD框架,将大型视频扩散模型蒸馏为少步生成器。实验显示,TMD能实现超70倍加速,质量损失小,用户也更偏好其生成的视频。
让大模型上车:理想汽车硬件协同设计算出最佳边缘模型
长三角洲AI实验室、中科院、理想汽车等找到大语言模型硬件协同设计寻优之路,在相同延迟下降低端侧模型困惑度,压缩模型架构挑选时间。研究揭示缩放定律,打造硬件感知建模框架,找到精度与延迟最优解。