经验驱动训练」共找到 3126 篇相关文章

推荐文章7

“光靠人盯不住了”!拆解上万张晶圆,这家公司靠AI将芯片良率提升数个百分点

喆塔科技创始人赵文政称国内跑通AI的半导体工厂少,工业AI尚处发展阶段。喆塔将DeepSeek接入自研大模型,提升训练效率。还分享了团队实例,强调工业AI决胜点在行业知识。此外,介绍了喆塔切入AI领域的过程、应用成果、面临挑战及未来策略等。

AI前线
新闻资讯8

DeepSeek-R2尚未问世,微软小模型捡漏称王?6000样本炼出「数学作弊器」!

微软推出Phi-4推理模型系列,参数最多14B,能在本地高性能笔记本电脑上流畅运行。Phi-4-mini-reasoning在数学推理上性能超越DeepSeek-R1蒸馏模型,且参数规模更小。文章还介绍了模型特点、训练方法、性能表现及局限性等。

新智元
新闻资讯8

AI创业,已经没有“出海”这个词了丨量子位沙龙

量子位举办「聊聊出海应用、场景与渠道」沙龙,实战派分享AI出海生存逻辑,涉及搞钱、降本、捷径等方面。指出AI出海下半场是“去AI化”,用户更关注能否解决问题。还介绍了各企业负责人观点与经验

量子位
技术分享7

【博客转载】NVIDIA Docker CUDA Compatibility /Nsight Compute In Docker

本文围绕NVIDIA Docker CUDA兼容性及Nsight Compute展开。指出使用NVIDIA NGC CUDA Docker容器时,要保证宿主机CUDA驱动与容器内运行时库版本一致,否则会有问题。还介绍了在Docker中安装和使用Nsight Compute的方法及示例。

GiantPandaLLM
8

刚刚,中国AI闯入全球编程前二!前面只剩Claude

Code Arena最新榜单出炉,Qwen3.7 - Max以1541分冲进全球第四,是前五中唯一非Claude模型。它在多项测试中表现出色,是为长时间自主执行任务设计的Agent基座模型,编程跃升或与环境扩展、长程自主执行训练方法升级有关。

新智元
新闻资讯8

解析科大讯飞:把AI做成懂你的那一个|甲子光年

2025年中美AI发展路径分化,中国企业探索本土商业化道路。科大讯飞董事长刘庆峰提出自主可控、软硬一体、行业纵深、个性化四个关键词。其用华为昇腾芯片训练出可商用大模型,在多领域展现优势,还发布新功能和产品,为AI商业化提供“中国答案”。

甲子光年
算法论文7

小扎「梦之队」首批论文上线!LLM自举进化,单步性能狂飙22%

Meta超级实验室MSL新论文探索用强化学习微调大语言模型。提出探索迭代(ExIt)法,基于RL自动课程学习,训练仅需单步任务,模型学会多步自我改进。在MLE - bench上,ExIt相对GRPO提升约22%。

新智元
新闻资讯7

谷歌迎来“DeepSeek时刻”!TurboQuant引爆AI圈、全球开发者疯狂复现:6倍无损压缩,内存股集体暴跌

谷歌研究院发布 TurboQuant 压缩算法,能在提升速度、保持准确性的同时,降低大语言模型内存占用,可将键值缓存压缩至少 6 倍,速度最高提升 8 倍。该技术无需额外训练,精度零损失。目前虽未大规模部署,但已引发内存股下跌。

AI前线
推荐文章8

拒绝视频生成,深度跃迁提出具身基座模型全新路线

深度跃迁发布世界动作模型 DELE - w0.5,放弃基于视频生成模型的路线,训练时联合学习动作与未来世界表征,推理时移除该表征分支。在真机实验中表现超基线,具跨背景泛化能力,为世界模型提供新思路。

机器之心
产品应用7

500万次围观,1X把「世界模型」真正用在了机器人NEO身上

1X公司为机器人NEO引入1X World Model,使其学会‘想象’。该模型借助视频预训练,不依赖大规模机器人数据和遥操作演示,能泛化到新场景。实验显示其在多任务上表现不错,但精细操作有挑战。

机器之心