可动三维模型」共找到 9919 篇相关文章

算法论文8

75%预训练数据都能删!Jeff Dean新作:全自动筛除低质量数据

Google DeepMind团队开发的DataRater全自动评估数据质量,用元学习筛选有价值数据,提升模型训练效率。它能减少计算量、提高性能,在低质量数据集效果佳,还能跨模型规模泛化。

新智元
算法论文8

DeepSeek-V3再发论文,梁文锋署名,低成本训练大模型的秘密揭开了

DeepSeek 发布围绕 DeepSeek-V3 的技术论文,从硬件架构和模型设计双重视角,探讨实现经济高效的大规模训练和推理的方法。介绍了 DeepSeek-V3 的创新设计,如 DeepSeekMoE 架构、MLA 架构等,还给出未来硬件架构设计建议。

机器之心
新闻资讯7

“像把大象塞进冰箱一样困难”,端侧大模型是噱头还是未来?

InfoQ《极客有约》X AICon 直播聚焦端侧大模型,探讨其落地挑战与破局思路。专家指出端侧部署有隐私、用性等优势,但面临内存、精度等难题。华为、支付宝等分享方案,还探讨应用场景、商业模式及未来趋势。

InfoQ
新闻资讯7

前百川智能联创焦新创业公司曝光,新项目已上线 App Store

前百川智能联创焦新创业公司曝光,其推出的AI语音产品“来福”已上线App Store。该产品定位AI语音电台应用,探索声音交互场景,目前仅邀测。国内大厂未推专注AI播客独立产品。

AI科技评论
产品应用7

字节跳动发布Seed 2.0系列模型,数学能力超越GPT-5.2 High

字节跳动Seed团队发布Seed 2.0系列模型,含Pro、Lite和Mini版。该系列在数学、代码、多模态理解等方面表现出色,价格优势明显,但在编程、事实准确性上与部分竞品有差距,已开放API。

AI工程化
算法论文8

LLM-based Reranker效果到底如何?一项关于SoTA模型的全面分析

在信息爆炸时代,重排序是信息检索系统核心。论文对22种重排序方法实证研究,构建无污染数据集FutureQueryEval。结果显示LLM重排序器泛化能力被高估,轻量级模型有优势,为研究和应用提供指南。

深度学习自然语言处理
新闻资讯8

林俊旸从阿里离开后首度发声:推理模型的时代快结束了

前通义千问Qwen负责人林俊旸离职后发长文,指出AI正从「推理思考」转向「智能体思考」,分析推理模型发展,谈混合思考模式失败,还提及智能体思考挑战及相关企业、学术界进展。

花叔
产品应用7

深度体验TRAE SOLO 正式版,总结一点技巧(附完整重现提示词和源码)

TRAE SOLO正式版面向国际版所有用户全量上线,模型能力提升且限免。它是响应式编码特工,适合复杂任务。有打通‘行动➔验证’闭环、SubAgent管理上下文等亮点,正式版还有多处升级,作者分享实战技巧。

宝玉AI
算法论文8

10行代码,AIME24/25提高15%!揭秘大模型强化学习熵机制

来自多机构的研究者揭示大模型强化学习中熵变化机制。发现策略熵在训练中急剧下降致性能停滞,提出 Clip - Cov 与 KL - Cov 两种正则化技术调控高协方差标记,遏制熵塌缩,在部分数据集上性能提升显著。

机器之心
推荐文章8

拒绝重复造轮子!抽象 80% 工作场景,打造复用的"AI 助手工厂”

文章指出,为解决重复开发AI助手的效率问题,智空间团队将高频需求抽象为复用技术方案,打造“AI助手生产线”。介绍四大高频场景本质、共性挑战及对应方案,还阐述分层架构、解决方案、prompt架构等,最终落地“助手工厂”产品。

阿里云开发者