中科大」共找到 6834 篇相关文章

开源动态8

国产LLM爆发的一周,Hugging Face热榜被承包了!

这一周国产开源LLM集爆发,GLM - 4.5、Qwen3的5连发、Step3等接连发布。GLM - 4.5是新一代开源SOTA模型;Qwen3各版本在不同能力上提升显著;Step3是多模态推理模型;腾讯还发布了混元3D世界模型1.0。

PaperAgent
算法论文7

AI集体“听不懂”!MMAR基准测试揭示音频模型巨短板

MMAR基准测试对30款音频相关模型进行测试,结果显示,多数开源模型面对复杂音频推理任务远未达实用水平,音乐任务所有模型表现不佳,且有显式推理能力的模型表现更优。

量子位
推荐文章8

对话RoboScience邵林:VLOA模型如何突破具身智能泛化瓶颈

本文对话RoboScience联合创始人邵林,探讨VLOA模型突破具身智能泛化瓶颈。他介绍了模型优势、设计思路,对比VLA,还谈及范式、难点及落地场景等,强调以人心、做有温度技术,重视模型落地。

甲子光年
算法论文8

一种基于滑动层合并的高效深度修剪模型的方法

文章指出深度修剪可加快推理速度,但直接丢层会降低性能。为此提出滑动层合并法,根据相似度阈值融合连续层,简化结构且保持性能。实验显示该方法优于现有技术,还揭示了与宽度修剪结合的潜力。

机器学习AI算法工程
开源动态7

DeepSeek R1 迎来小更新升级,性能直逼 OpenAI o3!

昨日,DeepSeek 发布 R1 模型最新版本 DeepSeek - R1 - 0528 并开启公测。虽官方未附详细技术说明,但用户反馈推理和输出有改进,也有性能方面的不同看法,其在基准测试表现佳。

AI科技大本营
推荐文章7

【访谈】在黑箱寻找自我显影——对话苏仲尧|三影堂厦门

苏仲尧个展《打开黑箱说亮话》聚焦摄影人机互动,引向对‘技术黑箱’思考。创作分三阶段,从文字照片到金属板,再结合AI。他将创作主导权回归自身,借作品探讨技术与人关系及当下处境。

三影堂摄影艺术中心
新闻资讯7

五一瓜!英伟达强烈批评Anthropic,造谣国走私AI芯片

CNBC消息,Anthropic在文章国用“孕妇肚子”和活龙虾运输AI芯片,英伟达强烈批评,认为应专注创新。美国“AI扩散规则”即将生效,特朗普拟更新限制措施,Anthropic依赖英伟达硬件却呼吁更严限制。

AIGC开放社区
产品应用8

Thinking Machines发布首个产品Tinker :模型后训练彻底变天

OpenAI前CTO Mira Murati的Thinking Machines公司发布首个产品Tinker,这是为微调模型设计的灵活API,能简化LLM后训练过程,让用户专注算法和数据,平台处理分布式训练。它有多种特性,已被顶尖机构采用。

AI寒武纪
推荐文章8

Kimi 模型训推混部的稳定性与资源优化实战

月之暗面系统工程师黄维啸在 QCon 会分享 Kimi 模型训推混部实践。介绍了训推集群挑战,如故障多、资源利用低等,还阐述了全链路稳定性提升、资源高效利用及强化学习混合部署等方案。

InfoQ
产品应用7

用最简单的模型技术打造一个迁云专家有多难?

文章探讨在云迁移领域用模型技术“复制”专家80%核心能力。分析标准化方案不足及简单RAG局限,介绍“LX0.1”AI专家助手构建,还提及分层评测、人机协同等优化,最后展望AI在云迁移的未来方向。

阿里云开发者