大模型评测」共找到 9311 篇相关文章

新闻资讯8

“今天的顶级智能,一年后就会沦为平庸的廉价品” OpenAI总裁:AGI 的终极交互是“没有界面,没有产品”

OpenAI总裁Greg Brockman分享了对AI发展的看法,称2023年推出的插件功能失败,因当时模型未准备好。他认为未来AGI是隐形虚拟助理,无界面和产品。还指出算力稀缺,智能折旧快,模型改进空间

AI科技大本营
开源动态8

QwenLong-L1.5发布:一套配方,三法宝,让30B MoE模型长文本推理能力媲美GPT-5

通义文档智能团队推出QwenLong - L1.5,提供长文本推理后训练“配方”,含数据合成管线、强化学习方法和智能体架构。通过三“法宝”重塑模型能力,效果显著,相关代码已开源。

AINLPer
算法论文7

代码榜刷满分,AI科研却撞墙?140道真实研究题撕开「自进化」真相

新工作MLS - Bench覆盖12领域、140个研究任务,评测前沿模型科研能力。虽模型工程执行强,但科学发现能力弱,当前仍难提出有效算法创新。其评测已纳入Kimi K3和Qwen3.8 - Max官方发版表。

新智元
开源动态8

突然,被GLM-4.7的Coding交付能力惊到了

国内模型圈因智谱启动A股上市而兴奋时,GLM系列再展“卷王”姿态,本月开源旗舰GLM - 4.7。它从代码模型变为任务交付引擎,实测在多场景表现出色,能理解复杂意图、交付高质量代码。

PaperAgent
推荐文章8

从数据到决策:AI 驱动的 Quick BI 架构设计与实践

阿里云智能集团瓴羊高级技术专家王璟尧,介绍阿里云 Quick BI 从传统 BI 到 AI 驱动的智能 BI 的进化,解析领域模型与 BI 引擎协同设计等技术权衡,为行业提供可复用技术范式。

InfoQ
产品应用8

单机狂飙4万亿参数,国产AI「四天王」首次合体!这台超节点鲨疯了

国产「四开源天王」可在单机运行,背后是「元脑SD200」超节点。它有超显存、高速互联域和超强算力,支持64路本土GPU且可商用。浪潮信息以开源为战略加速模型商业化落地。

新智元
产品应用8

5000万用户、5000万美金ARR,全球第一AI创作消费平台要做AI时代Roblox

在AI模型军备竞赛中,用户侧出现‘智能过剩’。SeaArt成立两年半成全球访问量第一的AI内容创作社区,其2.0版本SeaVerse实现全流程自动化。该公司不陷‘卖模型’陷阱,商业模式独特,有望成AI时代全民级内容平台。

机器之心
算法论文8

刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习

腾讯混元团队和复旦联合团队发布姚顺雨署名首篇论文《CL - bench》。论文证实模型在上下文利用上有能力短板,还构建了CL - bench评测基准,评估发现前沿模型在上下文学习上表现差,未来要让上下文学习走向现实。

机器之心
开源动态7

卷疯了!这个清华系Agent框架开源后迅速斩获1.9k stars,还要“消灭”Prompt?

随着模型能力突破,Agent 从概念走向应用,各类框架不断涌现。清华系团队发布开源框架 Cooragent,获 1.9k stars。创始人王政分享 Agent 发展洞察,指出模型能力提升推动 Agent 商业化,还探讨 MCP、框架等多方面问题。

AI前线
产品应用8

全球首个「导航脑」上线!一句话让机器人自己找路回家

银河通用联合多所学发布全球首个跨本体全域环视导航基座模型NavFoM,让机器人能自主导航。它全场景、多任务、跨本体,重新定义导航逻辑,有技术创新和庞训练数据,还衍生应用模型推动具身智能商业落地。

新智元