评估驱动开发」共找到 2707 篇相关文章

开源动态8

MiniMax 上市后的第一个开源:给 Coding Agent 立个规矩

2026 年初 MiniMax 成功上市港股,市值达 1100 亿港币。其上市后首个开源项目 OctoCodingBench 聚焦 Coding Agent 评估,解决规则复杂时 Agent 合规问题,为其立规矩,有重要社区价值。

MacTalk
算法论文7

多模态推理新基准!最强Gemini 2.5 Pro仅得60分,复旦港中文上海AILab等出品

现有多模态大模型benchmark对逻辑推理理解不足,复旦大学等单位提出MME - Reasoning评估其推理能力。对30 + 模型评测,最优得分仅60%左右,反映出模型多方面推理短板。

量子位
开源动态8

几张GPU干翻超算!耶鲁AI颠覆化学合成,实验成功率71%

近日,耶鲁大学李昊特团队开发 AI 系统 MOSAIC,将化学合成知识分 2498 个领域训练专家模型。测试中对超 35 种新化合物合成成功率达 71%,还完成难反应与新反应,相关论文发表于《自然》。

DeepTech深科技
算法论文8

清华挖出「幻觉」的罪魁祸首:预训练产生的0.1%神经元

清华大学孙茂松团队从神经元角度研究LLM幻觉微观机制,发现不到0.1%的H - 神经元可预测幻觉,与过度顺从行为相关,根源在预训练阶段,为解决幻觉问题、开发可靠大模型提供新思路。

新智元
产品应用7

一块画板,Nano Banana,无限创意:谷歌新工具实测

谷歌Labs推出AI概念板Mixboard,由Nano Banana图像模型驱动,整合Gemini 2.5 Flash模型。可上传个人图像混合编辑,适合设计师等。现仅在美国公开测试,速度快,操作便捷,能高效验证想法。

AI进修生
新闻资讯7

FriendliAI获2000万美元,以加速AI模型推理工作负载

专注AI推理的初创平台FriendliAI获2000万美元种子扩展轮融资,资金用于加速平台开发。其专有推理优化技术可降低模型运行成本和能耗,能为用户省90%的GPU成本,合作客户广泛。

AIGC开放社区
新闻资讯8

亚马逊CEO:坚信AI Agent,能改变世界工作、生活方式

今天凌晨,亚马逊CEO Andy Jassy发文分享对AI Agent看法,坚信其会改变工作和生活方式。亚马逊内外积极应用,在购物、广告等多领域有成果,未来还将深入开发,预计员工总数会减少。

AIGC开放社区
新闻资讯7

为什么HBM能摆脱传统周期?

当前市场对HBM和DRAM能否摆脱传统半导体周期性存争议。过去半导体周期由消费电子换机节奏驱动,而AI推理不同,大模型推理对内存依赖是硬约束,GPU更新对HBM需求几乎注定指数级增长。

newtype AI
新闻资讯7

多模态 +Agent 在培训与教育领域的应用|QCon 北京

4月16 - 18日,QCon全球软件开发大会将在北京举办,聚焦Agentic AI等前沿话题。北银金科尹辰轩将分享《多模态 + Agent在培训与教育领域的应用》,探讨多模态模型推动AI场景扩充等内容。

InfoQ
开源动态8

OnlyOffice 平替,用 Vue3 + Vite 做了个“本地 OnlyOffice”:接入成本低到离谱!!!

文章介绍 onlyoffice-web-local 项目,它是基于 OnlyOffice 的纯前端本地网页文档编辑器,无需服务器端处理,部署轻、接入快、更安全。阐述其功能、适用场景,给出开发部署及集成方案,可作 OnlyOffice 平替。

小华同学ai