「用户偏好数据」共找到 3805 篇相关文章
大语言模型离“数学证明高手”还有多远?斯坦福、伯克利、MIT 团队提出 IneqMath 评测标准
现在很多大语言模型常给出看似正确的结论,但推理过程却有问题。斯坦福、伯克利和MIT团队提出新思路,构建IneqMath数据集及‘AI数学裁判系统’,研究发现很多模型推理不严谨,还给出两个提升准确率的办法。
颜水成领衔,给AI分段位!超100款多模态模型,无人达到L5
十所顶尖高校联合发布General - Level评估框架和General - Bench基准数据集,用五级分类制明确多模态通才模型能力标准。评估超100款模型,发现多数在L2 - L3,无L5模型,揭示当前模型不足。
端侧AI从「能跑」到「会进化」,元空智能跑进惠普预装
北大出身的创业团队元空智能,提出大模型静态互联网数据红利见顶,端侧是下一轮能力跃迁核心,重新定义端侧AI为「模型×Agent×设备」,发布Boxer端侧模型与两款Agent产品,其端侧AI已拿下惠普商务电脑预装,实现规模化落地。
Claude第一款AI桌宠硬件,深圳制造
Anthropic的开源项目Claude-Desktop-Buddy,首款AI桌宠硬件用深圳M5Stack的M5StickC Plus。A社选它或因工程师是用户且新款常断货,也因其文档和代码可靠。深圳供应链强,M5Stack调整使命为AI世界准备基建。
苏度 WAIC 首秀:从1到10+技能跃迁,探索通用机器人 Scaling 路径
WAIC 2026上,苏度科技机器人展示了抓取物品等技能,稳定性等表现出彩。苏度成立一年获200亿估值,其创始人苏昊等技术实力强。它构建能力积累体系,采用虚实融合数据路线,坚持软硬件一体,多场景落地成果佳。
全球首个「导航大脑」上线!一句话让机器人自己找路回家
银河通用联合多所大学发布全球首个跨本体全域环视导航基座大模型NavFoM,让机器人能自主导航。它全场景、多任务、跨本体,重新定义导航逻辑,有技术创新和庞大训练数据,还衍生应用模型推动具身智能商业落地。
对谈 Chai-2 核心科学家乔卓然:抗体生成成功率提升百倍,分子生成平台是药物研发的 GPU|Best Minds
文章访谈 Chai Discovery 创始科学家乔卓然,探讨 Chai-2 设计理念与行业意义。Chai-2 能零样本生成活性抗体,成功率提升百倍,将开发周期从数月缩至两周。未来分子生成平台或成药物研发的 GPU,合成数据将成“第三模态”。
用印度程序员冒充 AI 的“独角兽”彻底倒闭了!伪 AI 烧光 5 亿美元,连微软和亚马逊都被“坑”了
英国 AI 初创公司 Builder.ai 正式破产,曾获微软等支持,估值近 10 亿美元。其宣称用 AI 构建应用,实际靠大量人力,还压榨开发者。此外,不少创业公司也用“人扮 AI”换融资,最终坑了投资人和用户。
文库 GenFlow 2.0,如何把 AI Agent 卷成“专家级”?
百度启动文库与网盘AI重构工程,8月18日GenFlow2.0发布。它生成的报告格式专业,能让用户实时干预任务运行,HTML在线报告交付体验好。其靠100多个专家Agent工作,构建了清晰产品层次和分层策略。
如何让AI帮你做前端自动化测试?我们这样落地了
本文介绍阿里基于AI的UI自动化测试框架在专有云质量保障的实践。框架用开源browser - use等工具,采用自然语言驱动用例、动态元素定位等机制,还应对了大模型幻觉等挑战,也提及构建企业级数据分析Agent方案。