「探索与利用」共找到 7296 篇相关文章
开源多模态推理「破壁」时刻:MMFineReason助力4B逆袭30B
长期以来,开源多模态模型在复杂推理任务上与顶尖闭源模型有差距,核心痛点是高质量推理数据匮乏。上海AI实验室OpenDataLab团队开源MMFineReason框架及大规模数据集,小模型凭此实现性能逆袭。
大模型桌游试玩员来了:用五大画像模拟「千人千面」,评分精准度超越GPT-5.1
盛大东京研究院等团队提出MeepleLM,首个能模拟玩家视角给出建设性批评的虚拟试玩模型。它构建专属数据集,引入MDA理论,提炼五种玩家画像。实验显示其评分精准度超GPT - 5.1等通用模型。
股价暴涨32%!GLM-5登顶全球开源第一,25分钟一镜到底搓出完整系统
2026年初,智谱GLM - 5上线,它是全球首个在系统级工程能力上与硅谷巨头正面竞争的开源模型,发布后智谱股价暴涨32%。它能力惊艳,能完成复杂项目,成本可控,还适配国产算力。
我用GLM-5肝出一个Rust版Agent系统,Opus 4.6迎来了最强开源对手。
作者实测智谱发布的GLM - 5后,用其开发出Rust版Agent系统并开源。还对比GLM - 5与Kimi 2.5、Opus 4.6,认为GLM - 5写后端能力强,让普通开发者也能用高级架构能力。
这个春节,AI 不聊天了,开始替我买单
马年春节,腾讯、百度、字节跳动等大厂打响「AI 春节大战」。阿里旗下千问 APP 投入 30 亿启动「春节请客计划」,活动首日成绩显赫,还展示了跨应用调度等能力,探索出独特的「超级 Agent」路线。
【访谈对话】造过 Codex 的人,为什么每天用 Claude Code
Calvin French - Owen 曾参与构建 Codex,如今日常用 Claude Code。他与 Garry Tan 在 YC 播客对话,探讨了编程 Agent 产品哲学差异、分发逻辑、上下文工程等,还提及 Segment 重建、未来设想及安全等问题。
“英伟达 AI 项目数量已失控!”黄仁勋五杯酒下肚,把压箱底的都掏出来了
近日,英伟达黄仁勋与思科 Chuck Robbins 对话,黄仁勋指出编程是打字,是商品。英伟达 AI 项目数量‘失控’仍任其发展。他认为 AI 机会在‘被增强的劳动力’,提醒企业别成用 AI 最后一名。
大模型Agent的核心还是prompt? 目前有什么挑战?
文章指出大模型Agent核心并非Prompt,而是工程化架构设计、工作流编排与数据闭环。介绍Flow Engineering等概念及工具,分析规划、记忆、工具使用要点,还谈及开发面临的延迟、稳定等挑战,并给出应对建议。
世界模型混战,蚂蚁炸出开源牌
蚂蚁集团旗下蚂蚁灵波发布并开源通用世界模型 LingBot-World,全面开源代码和权重,不绑定硬件或平台。它在多维度有突破,虽有细节瑕疵,但单次生成近 10 分钟连贯视频或刷新纪录,还在 VBench 测试领先。
蚂蚁深夜开源比肩Genie 3的世界模型,我也看到了具身智能的未来。
蚂蚁旗下灵波科技凌晨开源世界模型LingBot-World,可对标Google Genie 3。它能实时交互生成世界,与视频生成模型不同。有三个版本,具备长时记忆稳定、风格泛化性强、动作代理出色等特点。