「能碳产业大模型」共找到 10323 篇相关文章
谷歌新版Gemini马甲被扒! LMArena实测:唯一能看懂表的AI, GPT-5乱答
谷歌Gemini 3.0疑似上线LMArena,其Pro和Flash马甲被扒。实测中,Gemini 3 Pro能精确看表,GPT - 5等表现不佳;SVG测试有提升但也有不足;还能作曲。不过评测方式老套,希望有新花样。
大语言模型离“数学证明高手”还有多远?斯坦福、伯克利、MIT 团队提出 IneqMath 评测标准
现在很多大语言模型常给出看似正确的结论,但推理过程却有问题。斯坦福、伯克利和MIT团队提出新思路,构建IneqMath数据集及‘AI数学裁判系统’,研究发现很多模型推理不严谨,还给出两个提升准确率的办法。
AI 终于能"玩手机"了:Mobile MCP 让大模型直接操控你的 iOS 和 Android
Mobile MCP 是开源 MCP Server,让支持 MCP 协议的 AI 客户端操控 iOS 和 Android 设备,通过自然语言指令完成操作,解锁自动化测试等场景,但成功率有待提升,目前更适合探索性测试等。
何恺明新作:给扩散模型加正则化,无需预训练无需数据增强,超简单实现性能提升
何恺明最新论文研究扩散模型与表征学习的联系,提出Dispersive Loss正则化方法。它无需正样本对,有高通用性、低计算开销等优势,在多模型测试中提升了生成质量,在其他任务也有潜力。
AI应用如何落地政企?首先不要卷通用大模型
ISC.AI 2025大会显示智能体技术加速渗透产业。360政企AI业务与智能体深度绑定,其落地有三重逻辑:不追通用大模型,聚焦小场景;用“乐高式”工厂赋能;安全与AI深度融合是必选项。
腾讯重磅开源!端到端视频音效生成模型HunyuanVideo-Foley
腾讯混元正式开源端到端视频音效生成模型 HunyuanVideo-Foley,适用于多场景。它采用新型框架结合 REPA 策略,有三大核心优势,能适配多种场景,抑制底噪,保证音频保真度。
Qwen3小升级即SOTA,开源大模型王座快变中国内部赛了
开源大模型进入中国时间,Kimi K2风头正盛时,Qwen3迎来升级,235B总参数量仅为Kimi K2四分之一,基准测试性能却超它。Qwen官方不再用混合思维模式,新模型仅支持非思考模式,此次是小更新,大招在后头。
ICLR 2026 | ProSafePrune:一剪见效,告别大模型过度防御
合肥工业大学与科大讯飞联合团队提出全新低秩参数修剪框架 ProSafePrune,被 ICLR 2026 录用。它能精准定位模型认知偏差并修剪,降低过度拒绝率,不损安全防御能力,还提升通用任务性能,为 LLM 安全部署提供新思路。
大模型如何泛化出多智能体推理能力?清华提出策略游戏自博弈方案MARSHAL
近日,清华大学等机构研究团队提出 MARSHAL 框架,利用强化学习让大模型在策略游戏自博弈。实验表明,多轮、多智能体训练提升了模型博弈决策水平,将推理能力泛化到通用多智能体系统,在一般推理任务表现显著提升。
大模型一年内就会吞噬 Harness!Google AI Studio负责人:深耕垂直领域才是创业公司唯一生路
Google AI Studio负责人Logan认为,大模型一年内将吞噬Harness,90%的Agent中间件公司最多存活12个月。创业公司应深耕垂直领域,Google用Anti - Gravity平台串联产品,推动智能体发展,且模型后训练潜力巨大。