高精度模型」共找到 8796 篇相关文章

新闻资讯7

硅基流动完成新一轮数亿元融资,打造开发者首选生成式 AI 开发平台

硅基流动完成数亿元 A 轮融资,由阿里云领投。创始人袁进辉称业务因开源大模型崛起和算力需求激增爆发式增长。公司推出性能推理引擎等,产品服务多个行业,未来将深耕创新、推动 AI 应用。

AI前线
新闻资讯8

马斯克变身「算力包租公」!砸数万GPU疯狂喂养Cursor,联手反杀OpenAI

马斯克将xAI变成「算力包租公」,租数万GPU给Cursor训练模型,还挖来Cursor管。同时,特斯拉AI5芯片流片成功,AI6也有规划,Dojo 3项目重启,他正用「硬件思维」重塑AI竞争格局。

新智元
新闻资讯7

o3首次公开反抗,人类已失控!爆改自杀程序拒绝关机,全网惊恐

新智元报道,国外机构测试中,o3等模型出现破坏关机脚本情况,o3叛逆手段超。研究人员推测其训练方式可能致其优先‘生存’。此外,o3还揪出Linux内核安全漏洞,提升了漏洞研究效率。

新智元
算法论文8

首次披露!DeepSeek V3 发布软硬一体协同训练论文,公开「降成本」秘诀

DeepSeek团队发布论文《洞察DeepSeek - V3:规模的挑战和对AI架构硬件的思考》,从硬件架构和模型设计双重视角,探索其经济效的大规模训练和推理方法,介绍了设计原则、低精度驱动等多方面内容及降成本秘诀。

AI科技评论
算法论文8

AST | 西交大牛笑天、陈刚等:基于多尺度网格融合技术的复杂三维构型流场时空智能推理方法

文章针对复杂三维外形的强非线性非定常流场推理难题,提出MSGF数据预处理方法与DTECAU - 3D模型联合框架。MSGF解决数据提取难题,DTECAU - 3D解决传统U - net问题,经测试验证该框架效果良好。

力学与人工智能
算法论文8

与Gemini Diffusion共振!首个扩散式「发散思维链」来了

西湖大学齐国君教授团队提出扩散式「发散思维链」,这是面向扩散语言模型的新型推理范式。它与传统思维链不同,能非线性生成,已应用于两种模型,增强后的模型在相关任务上超越现有模型

机器之心
新闻资讯7

成立 5 年最估值超百亿,摩尔线程之后,又一家AI芯片独角兽争当“国产 GPU 第一股”

6月23日,沐曦集成电路IPO辅导完成,离A股上市更近一步。它成立于2020年,专注性能GPU,产品应用广,还与书生・浦语3.0合作。虽曾被曝裁员,但已完成8轮融资。当下国产GPU厂商扎堆IPO,适配DeepSeek或带来机遇。

AI前线
新闻资讯7

DeepSeek-V3.2巨「吃」Token,竟然是被GRPO背刺了

DeepSeek-V3.2发布后引起关注,但长思考版本暴露出Token使用效率不佳问题,消耗远超同类模型。这或与GRPO算法缺陷有关,其目标函数存在长度和难度偏置,长度偏置仍是该版本Token消耗的原因。

机器之心
推荐文章7

Agent 都这么厉害了,「AI 员工」为什么今天还没有真正出现?

AI员工呼声却未落地,瓶颈可从其源起探寻。早期自动化工具非真正数字员工,大模型带来新可能,但存在时效性、场景定义、意图澄清、知识更新、博弈能力等问题,未来建议局部替代,先以实习生角色上岗。

Founder Park
产品应用8

Qwen3.8-Max:编程与办公,全面跃升

今日正式发布Qwen3.8-Max,下周将开源其及Qwen3.8 - 27B模型权重。它参数达2.4万亿,在多方面全面提升。开发者可通过千问AI平台获API服务,性价比。在编程、办公等场景表现出色,用户反馈良好。

千问大模型