「三阶段训练」共找到 3283 篇相关文章
从被吐槽“套壳中国大模型”到自研封神!首次揭秘Cursor背后极速代码Agent如何对标GPT5.1 Codex,生成效率提4倍
10月29日,Cursor 2.0发布Composer大模型,效率约为其他模型四倍。开发者分享其成极速代码Agent方法,如强化学习、平衡训练与推理负载等,还提及未来方向及研发反思。
沉默的进化:LatentMAS 如何通过“潜意识通信”重塑多智能体协作?
这是对多智能体协作领域突破性研究的深度解读。论文提出LatentMAS框架,让智能体直接交换“思维向量”,实现“机器心灵感应”,在性能、速度和Token消耗上全方位碾压传统文本交互模式。
「2025中国科技产业投资榜」榜单揭晓|甲子引力
2025甲子引力年终盛典在北京举办,现场发布【2025中国科技产业投资榜】,呈现投资机构卓越表现。2025年全球资本市场复苏,中国科技产业迈入关键阶段,投资具‘硬科技主导、长期主义、生态化布局’特征。
这下Altman急了,OpenAI紧急启动「红色警报」
ChatGPT三周年后,Altman宣布OpenAI进入红色警报状态,调集资源改进ChatGPT。此前谷歌曾因ChatGPT威胁发布红色警报,如今谷歌等对手快速追赶,OpenAI多产品后续乏力,还面临增长与融资压力。
五年,终于等来Transformers v5
Transformers v5发布首个RC版本v5.0.0rc0,跨越从v4到v5长达五年的技术周期。其日下载量从2万次激增至超300万次,总安装量突破12亿次。v5将PyTorch确立为唯一核心后端,聚焦四大维度进化。
Meta通过简单算术解锁LLM SoTA性能
大型语言模型训练耗算力与时间,传统模型融合方法有局限。本文提出SoCE新方法,通过筛选专家模型、非均匀加权平均融合,在多评测中实现先进性能,为LLM优化提供新思路。
模型汤新做法!Meta|提出“类别专家汤”:SoCE,大幅提升模型性能,刷新SoTA!
大语言模型领域,提升性能常需高算力、大量数据和长时间训练。Meta提出新型模型汤技术SoCE,通过分析类别相关性操纵模型权重,在BFCL上刷新SOTA记录,为开源社区指明低成本进化之路。
用155万模拟视频给模型上课!GVE模型一次学会9种视频检索技能
当前视频检索研究陷入困境,现有模型难以应对复杂检索需求。香港科技大学(广州)联合阿里巴巴通义实验室推出通用视频嵌入模型GVE,其在零样本设置下超越14个主流模型,全链条创新为视频检索通用化奠定基础。
奥特曼连夜挖走英特尔CTO!AI首席突然叛逃,陈立武被迫亲自挂帅
今天,英特尔CTO兼首席AI官Sachin Katti突然离职,加入OpenAI打造算力基础设施。OpenAI正内外结合布局算力,而英特尔在AI转型艰难时痛失人才,CEO陈立武接管AI业务。
两周复刻DeepSeek-OCR!两人小团队还原低token高压缩核心,换完解码器更实用
两人小团队仅用两周复刻DeepSeek-OCR,复刻版DeepOCR还原其低token高压缩核心优势,还在关键任务上追上原版表现。它完全开源,无需大规模算力集群,训练方案适配中小团队。