「大模型发布潮」共找到 10153 篇相关文章
用更一致的轨迹、更少的解码步数「驯服」掩码扩散语言模型,扩散语言模型的推理性能和效率大幅提升
扩散大语言模型发展迅猛,或成下一代大语言模型基础范式有力竞争者。复旦大学等团队发布论文,提出高效解码策略与强化学习训练组合,解决MDLM解码和训练问题,提升推理性能与效率。
清华上交满分论文证明:强化学习并不能让大模型更会思考!
清华和上交在NeurIPS 2025的研究《Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?》获满分。研究聚焦RLVR,发现强化学习不能让大模型更会思考,推理能力上限仍由基础模型决定。
DeepSeek-R1登顶Nature,8位专家严审通过, 大模型「交卷时刻」来了
近日,DeepSeek - R1登上Nature封面,打破主流大模型未经过独立同行评审惯例。同行评审可理清模型机制,提升透明度与可信度,还能避免‘刷榜’‘自评’,虽有公司担心泄密,但它是验证成果的必要程序。
全国首部AI大模型私有化部署标准,公开征集起草单位和个人!
近期AI领域政策频出,企业对人工智能应用需求攀升,倾向私有化部署,但行业存在技术错配等问题。国内首部针对AI大模型私有化部署的标准《人工智能大模型私有化部署技术实施与评价指南》立项,正征集起草单位和个人。
大模型狙击黑产:挚文集团社交生态攻防实战全揭秘
挚文集团生态技术负责人李波在AICon大会分享大模型在社交生态落地实践。介绍集团生态问题,提出构建治理框架,还阐述多模态大模型研发方案、细粒度用户画像建设及审核侧应用,最后总结现状并展望未来。
Anthropic神话模型发布,但不让你用
Anthropic发布神话模型Claude Mythos Preview却不开放使用,发起玻璃翼计划联合科技巨头用该模型修复全球软件漏洞。此模型能自主发现众多零日漏洞,合作伙伴应用后强调跨行业协作应对网络安全挑战。
GPT-5.4发布,最适合OpenClaw的天选模型登场了。
GPT-5.4发布,作者认为它是OpenClaw天选模型。此前Claude贵且受限,GPT-5.3-Codex世界知识差。GPT-5.4代码能力强、世界知识优,还具多特性,如大上下文窗口,目前ChatGPT已上线。
Mistral AI发布一站式编程助手Mistral Code
法国开源大模型平台Mistral AI发布一站式编程助手Mistral Code,旨在解决企业开发人员使用AI编码工具时的合规与安全障碍。它基于Continue开发,集成四个大模型,还能在私有代码库微调,获早期客户认可。
大模型被确诊「视觉文盲」!多校联合提出MILO,为它植入空间想象力
空间推理是多模态大语言模型(MLLMs)应用关键挑战,当前‘语言描述式调优’让模型成‘视觉文盲’。多校联合提出MILO范式,结合视觉生成反馈与语言调优,还构建GeoGen数据集,经五大任务验证其有效。
对话淘宝姜宇宁:如果你只推低价商品,是不需要用大语言模型的
淘宝姜宇宁团队上线RecGPT百亿参数推荐大模型,对“猜你喜欢”功能技术升级。大模型赋予传统推荐系统新能力,如让其“白盒化”、理解长上下文等。姜宇宁认为AI要创造商业价值,落到业务场景形成正向循环。