训练技术」共找到 4623 篇相关文章

推荐文章7

AI 原生应用全栈可观测实践:以 DeepSeek 对话机器人为例

本文以 DeepSeek 对话机器人为例,介绍 AI 原生应用架构可观测需求、挑战与方案实践。分析 AI 领域痛点,提出阿里云 AI 全栈可观测架构,剖析大模型应用可观测技术,分享实战案例,还给出未来规划。

InfoQ
产品应用8

腾讯3D生成模型上新!线稿可变“艺术级”3D模型,鹅厂内部设计师也在用

腾讯上新艺术级3D生成模型Hunyuan3D - PolyGen,支持生成复杂几何模型,鹅厂游戏工作室用后美术师建模效率提升超70%。该模型在拓扑功能实测表现佳,还介绍了其核心原理和技术

量子位
新闻资讯8

国内外AI大厂重押,初创梭哈,谁能凭「记忆」成为下一个「DeepSeek」?

文章指出‘记忆’或成引爆新一轮AI浪潮的关键。当前,国内外AI大厂和初创企业纷纷入局,围绕‘记忆’研究是大模型新方向。‘记忆’是技术和应用的双重诉求,研究路线多样且各有优劣,未来竞争激烈,谁能突围尚未可知。

机器之心
8

五年,终于等来Transformers v5

Transformers v5发布首个RC版本v5.0.0rc0,跨越从v4到v5长达五年的技术周期。其日下载量从2万次激增至超300万次,总安装量突破12亿次。v5将PyTorch确立为唯一核心后端,聚焦四大维度进化。

机器之心
推荐文章7

大模型之外,向量存储如何支撑 Agent 的检索链路

文章指出大模型负责理解、推理和生成,而Agent需获取外部数据等。向量存储可将数据转化为语义向量,在Agent执行任务时找回相关内容。文章探讨向量存储技术方向,分享做法,还演示阿里云两种Serverless向量存储用法。

阿里云开发者
新闻资讯7

对话微分智飞高飞:看具身智能如何引发飞行认知革命 | GAIR 2025

雷峰网第八届GAIR大会邀请微分智飞高飞,探讨具身智能在飞行机器人领域应用。高飞指出其与传统无人机本质区别,介绍应用场景、分布式集群技术,还谈世界模型价值、挑战及创业契机,认为具身智能是历史拐点。

AI科技评论
推荐文章8

「上下文工程」 已经30岁了,而你可能刚知道它

上海创智学院刘鹏飞老师团队提出上下文工程2.0,剖析其本质、历史与未来。上下文工程已发展30年,是熵减少过程,旨在弥合人机认知鸿沟。其历史呈收敛曲线,每次技术突破引发三重连锁反应,当前人类正处通向3.0转折点。

量子位
开源动态8

代码生成要变天了?被质疑架空后,Yann LeCun携320亿参数开源世界模型“杀回来了”

在新一代代码生成模型不断涌现的当下,Meta FAIR CodeGen团队由Yann LeCun领导发布了代码世界模型CWM。它有320亿参数,创新训练方式使它不仅会写代码,还能模拟执行,性能测试表现不俗,在圈内引发热议。

AI前线
产品应用7

当AI从云端“下沉”,Arm如何赋能端侧

端侧AI发展近十年,已进入应用快速拓展期,成为推动消费电子革新重要力量,但面临视觉处理、内存平衡和应用迭代等挑战。Arm推出相关平台与技术,如SME2,提升AI性能与能效,还与厂商合作,持续创新赋能端侧。

芯师爷
算法论文7

LLM+RL遭严重质疑,随机/错误等虚假奖励也能提升至标准效果?

论文在AI领域观察到类似随机给糖或奖励错误答案让孩子成绩提升的现象,‘虚假奖励四大奇招’效果接近用标准答案训练,Qwen2.5 - Math - 7B模型在测试集上性能飙升,还揭示了Qwen特别的原因及随机奖励有效的推手。

深度学习自然语言处理