超参数调优」共找到 2667 篇相关文章

新闻资讯8

百度CTO王海峰:AGI曙光已现,Scaling Law仍有效|新智元十周年峰会

新智元十周年峰会,百度CTO王海峰分享AI发展。回顾十年,从AlphaGo到如今大模型爆发,AGI曙光已现。他指出AI具通用性和全面性,百度内部45%新增代码由AI生成,Scaling Law仍有效。

新智元
推荐文章7

大模型微调知识与实践分享

文章详细介绍大型语言模型(LLM)微调知识与实践,包括模型结构、参数量等知识,以及Prompt工程、数据构造、LoRA微调等技术点。还给出微调实践流程,介绍相关平台和框架,如星云、TuningFactory等。

阿里云开发者
新闻资讯7

650亿美元!IPO前夕,Anthropic营收底牌曝光

IPO前夕,Anthropic最新年化营收达650亿美元,8个月翻7倍,反OpenAI。双方在资本市场竞争激烈,A社在起跑时间、财务、商业模式上占优,但OpenAI用户规模和产品生态占优,目前A社牌面更好。

量子位
新闻资讯8

金融Agent再获近2亿加码!启明红杉高瓴集体押注,5个月内连获两轮融资

近日,讯兔科技完成近2亿元A轮融资,5个月内连获两轮。其核心团队有投研基因,产品Alpha派服务8万投研人员。投资人看好其发展,认为2026年垂直领域AI应用将爆发。

量子位
8

刚刚,DeepSeek扔出大杀器,梁文锋署名!暴力优化AI架构

2026新年第一天,DeepSeek发表梁文锋署名新论文,提出「mHC(流形约束连接)」架构。它仅增约6.7%训练时间开销,就能让27B参数模型性能显著提升,还可能淘汰ResNet结构。

力学与人工智能
新闻资讯8

阿里一口气发了N款新模型,让我们向源神致敬。

阿里云栖大会发布众多模型,有Qwen3 - Max、Wan2.5等。Qwen3 - Max对标顶尖模型;Wan2.5支持音画同出;Qwen3 - VL是强大视觉语言模型且已开源;Qwen3 - Omni是全模态模型。此外还有多个新模型,构建全场景生态。

开源星探
开源动态7

美团开源Agentic新王,速度拉满,工具调用打爆Kimi?

周末美团开源LongCat - Flash大模型,参数量560B,推理速度达100 token/s,成本低,在Agent工具调用表现Kimi - K2。它有Zero - Computation Experts和ScMoE创新,不过市场表现未获太多认可。

探索AGI
开源动态8

开源版Genie 3世界模型来了:实时+长时间交互,单卡可跑,国内公司出品

本月初 Google DeepMind 发布 Genie 3 引发关注,没过两周昆仑万维就推出开源交互世界模型 Matrix - Game 2.0,参数量 1.8B,单卡可跑,能实现实时长序列、交互式生成,经测试潜力大。

机器之心
新闻资讯7

独家 | 华为天才少年楼燚航离职创业,要做 200B 以上的「具身大脑」

前华为“天才少年”楼燚航离职创立引力蓝移,定位构建具身大脑。其采用分层架构,认为具身智能Scaling拐点已至,规划了数据来源和模型参数规模。正与汇川合作,按24个月规划推进,面临产品验证挑战。

AI科技评论
新闻资讯8

独家|「中科第五纪」完成数亿元A轮融资,率先开启海外商业落地

AI科技评论独家消息,具身智能企业「中科第五纪」近日完成数亿元A轮融资,年内已完成三轮。该公司还收获海外数亿订单。其提出少样本具身操作大模型等核心技术,形成完整技术体系。

AI科技评论