M3 - Bench」共找到 2259 篇相关文章

开源动态8

世界模型混战,蚂蚁炸出开源牌

蚂蚁集团旗下蚂蚁灵波发布并开源通用世界模型 LingBot-World,全面开源代码和权重,不绑定硬件或平台。它在多维度有突破,虽有细节瑕疵,但单次生成近 10 分钟连贯视频或刷新纪录,还在 VBench 测试领先。

AI前线
开源动态7

RunAnywhere:简单几步让AI应用跑在手机上

介绍能在手机本地运行的大模型项目RunAnywhere,它让开发者在iPhone 16 Pro Max部署Llama 3.2 3B模型。AI处理本地化,用React Native和RunAnywhere SDK,支持多模型,有多种功能,优势明显。

AI工程化
算法论文8

LLM规划能力飙升79%!Google:内在自我批评技术拿下多项SOTA

Google DeepMind研究《通过内在自我批评提升大语言模型的规划能力》,不借助外部验证器,让LLM反复“自评+重写”,使Blocksworld准确率从49.8%升至89.3%,还介绍了方法及跨模型验证情况。

PaperAgent
算法论文8

让 AI 自己打怪升级,Meta用Self-play RL把Coding推向超级智能

Meta FAIR、Meta TBD Lab等朝着“超级智能软件工程Agent”迈出第一步。SSR让大模型零人类标注,靠自生成Bug和自修复稳定碾压人类数据基线,新旧范式对比优势明显,还介绍方法、实验结果与理论洞察。

PaperAgent
产品应用8

以孔子命名,超越Claude 4.5 Opus,Meta发布工业级自我进化AI软件工程师CCA

Meta与哈佛联合推出工业级软件工程师CCA,它是一套让AI在工业级代码库协作的方法论,解决长上下文推理等难题。其三维解耦设计、精细记忆机制、自我进化能力获数据验证,还适合引入强化学习。

AIGC开放社区
新闻资讯7

GPT-5.2发布,真正的牛马打工人专属AI来了。

OpenAI十周年凌晨2点发布GPT - 5.2。它在部分跑分上提升不大,但在ARC - AGI - 2和GDPval评测集表现亮眼,上下文处理能力也大幅加强。将开放给会员使用,价格比5.1贵。

数字生命卡兹克
新闻资讯7

理想的眼镜,和李想的眼界

今年11月,李想称要让理想成具身智能领域最佳企业。一周后,理想发布AI眼镜Livis。Livis解决了轻便、续航与性能的矛盾,还利用造车积累实现资产复用。理想推它是因AI眼镜潜力大,能输出跨场景AI能力。

远川科技评论
新闻资讯8

梁文锋,Nature全球年度十大科学人物!

权威科学期刊《自然》公布2025年度十大科学人物榜单,梁文锋因DeepSeek模型对AI领域的重要贡献与变革性影响成功当选。此外,中国研究员杜梦然也因相关研究入选,还有多位其他领域人物因各自成就上榜。

量子位
新闻资讯8

100万亿Token揭示今年AI趋势!硅谷的这份报告火了

OpenRouter和a16z联合发布《State of AI:An Empirical 100 Trillion Token Study with OpenRouter》,基于100万亿Token分析模型真实使用情况,揭示2025年AI发展趋势,如开源模型崛起、推理模型成新范式等。

量子位
产品应用7

豆包官宣手机助手:AI 还能带来哪些新体验?

字节豆包团队官宣做手机助手,它基于操作系统层面授权,背靠豆包大模型带来交互创新。虽无自研手机计划,但正与多家厂商洽谈合作。开放体验机型是与中兴合作的nubia M153

AI科技评论