推理性能」共找到 3446 篇相关文章

开源动态8

节前重磅:开源旗舰模型新SOTA,智谱GLM-4.6问世

国庆前智谱AI发布新一代旗舰模型GLM-4.6并将开源,它在多方面提升,如编码、上下文长度等,评测性能佳,token消耗降低。经实测,其代码、研究、开发等能力强,成全球开源AI领域重要力量。

机器之心
产品应用7

Windsurf快被Devin搞垮了!bug 不断、官方“装死”,百万用户要“跑”了?

Windsurf近期出现性能降低等问题,社区抱怨不断,但官方却隐身不回应。此前公司经历变动,Devin集成到Windsurf后问题频出,如级联错误、积分消耗等,部分用户开始转向其他产品,其未来发展存不确定性。

AI前线
推荐文章7

CUTLASS CuTe GEMM细节分析(二)——TiledCopy与cp.async

文章深入分析TiledCopy,从参数理解、访存连续性等角度展开。介绍Tiler_MN和TiledLayout_TV意义及构造,指出访存连续性影响性能,还说明了基于cp.async构造TiledCopy的要点,如ValLayout选择和Layout限制。

GiantPandaLLM
算法论文8

IEEE TPAMI 2025 | 北京大学提出LSTKC++,长短期知识解耦与巩固驱动的终身行人重识别

北京大学周嘉欢团队在IEEE TPAMI发布LSTKC++研究成果。该框架引入长短期知识解耦等机制,保障模型学习新知识和记忆历史知识。代码已开源,研究在性能和效率上优势明显,有广泛应用价值和拓展空间。

机器之心
算法论文8

ACL 2025 | 指令遵循不能仅靠常识?GuideBench 揭示大模型如何“踩雷”领域指南规则

这篇ACL 2025主会论文聚焦提升智能体指南规则遵循能力。提出评估基准GuideBench,涵盖7类1272个任务。实验显示多数主流大模型指令遵循能力不佳,尤其数学推理挑战大,为模型迭代提供评估基准。

深度学习自然语言处理
算法论文7

SSM+扩散模型,竟造出一种全新的「视频世界模型」

在AI热词不断涌现的时代,斯坦福大学等机构研究将长上下文、状态空间模型、扩散模型等结合,创造全新「视频世界模型」。它用状态空间模型实现长期记忆,还设置局部注意力机制,训练和推理表现出色。

机器之心
新闻资讯8

DeepSeek之后,中国AI「自己出题」杀进Nature通讯!全球仅4家

一家成立不到两年的香港AI公司维纳智能,不堆参数、不依赖人工标注,靠让大模型自动生成高精度推理数据登上Nature通讯。其技术可解决Agent泛滥的困局,还推出特色产品,业务增长快。

新智元
新闻资讯8

月吞100万亿Token!AI中转站OpenRouter赚爆了

OpenRouter宣布完成1.13亿美元B轮融资,估值达13亿美元。它每周处理25万亿个tokens,全球用户超800万。其提供AI推理统一控制层,解决企业多模型管理难题,开源模型崛起使其价值凸显。

新智元
算法论文7

The Batch:927|极速扩散学习

研究表明扩散图像生成器学习重建预训练编码器嵌入可加快训练,Apple团队提出的FAE,通过缩小嵌入再重建解决了因嵌入尺寸大导致的训练受阻问题,性能与先进模型相当且训练更快。

DeeplearningAI
新闻资讯8

英伟达改卖Token?黄仁勋GTC后发声:token就是AI新通货,值钱的不是算力,是“每度电的智商”

英伟达黄仁勋在采访中强调其是加速计算公司,非单纯 GPU 公司。他认为 AI 竞赛从拼算力变拼产出,token 是新通货,还阐述了 AI 瓶颈、架构发展、推理编程、CPU 角色等观点。

AI前线