v3版本」共找到 2671 篇相关文章

算法论文8

为防AI刷题,Nature等顶刊最新封面被做成数据集,考验模型科学推理能力|上海交通大学

上海交通大学王德泉教授课题组提出MAC基准,用顶级期刊最新封面构建测试集,评测多模态大模型能力。研究设计两种含“语义陷阱”的测试任务,发现顶尖模型有局限,还提出DAD方法提升表现,采用双重动态机制。

量子位
产品应用8

那些让你「活人微死」的工作日,终于有救了

当前多数AI工具未打通工作流程,企业微信5.0版本却盘活内部协作、外部市场和数据资产。它有智能搜索、总结、机器人、表格等功能,还实现内部办公、内外连接、数据资产一体化,满足不同企业需求。

机器之心
开源动态8

6.6K Star 打破次元壁!MCP-Use开源爆火:6行代码让LLM操控万物!

在AI Agent开发热潮中,MCP-Use作为开源Python库爆火。它用6行代码让LLM操控万物,支持多模型、多服务器,提供安全机制,适配网页浏览、3D建模等多种场景,降低AI Agent开发门槛。

开源星探
产品应用8

让你抄袭都跟不上节奏

最近 Dia 连更两小版本,推出 Skills Gallery 和 Research 功能,即扩展技能库和深度研究能力。它更新似微信,节奏快创意足,让对手难抄袭。目前免费,仅 M 芯片苹果电脑可用,文末有邀码获取方式。

MacTalk
开源动态8

Agent KB:经验池让Agents互相学习!GAIA新开源SOTA,Pass@1性能最高提升6.66

来自多家机构团队发布 Agent KB 框架,构建经验池实现 AI Agent 经验共享。在 GAIA 基准测试中表现出色,提升多模型 Pass@1 性能,还在软件工程领域展现价值。其设计精妙,经消融、检索策略等实验验证有效。

机器之心
8

ART:构建可靠智能体的强化学习新框架

现有AI智能体在真实场景表现不稳定,阻碍其应用走向生产。ART开源强化学习框架诞生,通过分离“前端”与“后端”、兼容OpenAI推理端点等创新化解困境,还给出使用方法,在案例中展现强大效能与经济性。

AI工程化
新闻资讯8

Cursor终结者?Grok 4正式登顶!马斯克扬言编程碾压,20万N卡年赚47亿美金!

时隔5个月,xAI发布通用模型Grok 4,后续还将推编码、多模态代理和视频生成模型。Grok 4已上线,有三个订阅版本。马斯克称其智能超博士生,在多基准测试中领先,编码或超Cursor。

InfoQ
算法论文8

从「记忆解题」到「深度推理」:港科大推出首个本科数学动态评测基准 UGMathBench

港科大团队发表在 ICLR 2025 的研究 UGMathBench,是首个本科数学动态评测体系。它涵盖 16 个学科领域,通过变量扰动创建多版本试题,引入创新指标评估模型推理能力,测试结果揭示了当前模型短板。

AI科技大本营
算法论文7

Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制

论文研究发现大模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律分析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。

深度学习自然语言处理
新闻资讯7

刚刚2岁的Llama,「爸妈」都跑了!小扎手拆Meta AI,LeCun保持独立

面对谷歌、OpenAI等劲敌及Llama 4翻车、人才流失困境,小扎决定重组Meta GenAI团队,设三大架构。2023年Llama首版论文14名作者只剩3人,Llama 4也问题不断,而LeCun坚持自己的路线。

新智元