基准构建」共找到 2650 篇相关文章

算法论文8

解决Agent幻觉:HaluMem精准定位记忆系统的“说谎”环节!

近年来,LLM和Agent在记忆管理上存在挑战,现有评估方法无法定位幻觉来源。论文提出HaluMem评估基准,通过三大任务和两个数据集揭示记忆系统幻觉行为,为开发可靠记忆机制提供指导。

深度学习自然语言处理
新闻资讯8

祝贺小马智行港交所上市!|5Y News

11月6日,小马智行在港交所主板挂牌上市,成2025年全球自动驾驶最大IPO。此前已在美上市,构建“美股+港股”架构。创始人称站在商业化前夜,其核心业务多元,成本下降,还拓展全球版图。

五源资本 5Y Capital
算法论文8

清华、快手提出AttnRL:让大模型用「注意力」探索

清华和快手团队提出新框架AttnRL,引入注意力机制提升过程监督强化学习效率与性能。它解决传统方法在分支位置选择和采样策略上的效率问题,实验显示在多基准测试中表现优异。

机器之心
算法论文8

CVPR 2025 | 多模态统一学习新范式来了,数据、模型、代码全部开源

中国人民大学、清华和腾讯合作的CVPR 2025论文指出,当前多模态学习范式有缺陷。为此提出新范式,构建AV - UIE数据集、Crab框架,实现任务互助,在多任务上超垂类专家模型,数据、模型、代码开源。

机器之心
新闻资讯7

4月22-25日,CCBN2026将在首钢园举办

第三十二届中国国际广播电视信息网络展览会(CCBN2026)4月22 - 25日在北京首钢国际会展中心举办。展会构建多元体系,汇聚众多企业机构,亮点包括数智引领、超高清创新等,还推出展商专属权益计划。

首钢园
产品应用7

数字技术工人已到岗!时序大模型+Agent已掌握了工厂生产管控技术,比人类更懂工况

基于时序大模型和Agent的数字技术工人,能承担生产操作等关键任务,接手复杂工业环节。国内AI团队打造的河谷平台构建智能体,自研底层技术,以工艺维度训练,上岗快,极峰科技还创新商业模式。

量子位
产品应用8

刚刚,全球首个加密AI产品完成保险签约!你敢用,它敢赔

7月7日,荆华密算与人保北京市分公司、AI原点社区签下全球首单AI企业数据损害赔偿责任保险。荆华密算构建“双重信任闭环”,一手技术自证,一手保险兜底,其产品“墨镜熊”正在内测。

新智元
新闻资讯7

B站爆了!Hermes首度直播回应「抄袭」,MiniMax提前杀入Harness赛点

Hermes Agent业务负责人回应抄袭质疑,技术对谈探讨AI竞争新维度。MiniMax动作密集,构建“Model + Harness”双向飞轮,其模型获海外开源圈认可,产品驱动模型优化,还与云厂商合作解决沙箱问题。

新智元
新闻资讯7

智能体工程的演进:从“是否”到“如何” | 2025年AI智能体状态调查报告【PPT】

进入2026年,企业对AI Agent关注点从构建尝试转向规模化稳定部署。LangChain公司年底发布《AI Agent现状报告》,基于对超1300位相关人员调研,展示智能体工程化图景与趋势,本文拆解报告精华。

AI大模型应用实践
推荐文章7

The Batch: 892 | 教育应与 AI 协作,而非对抗

三年多前ChatGPT发布,教育改变。曾寄望用AI检测器识别生成文本,但学生易规避。检测难维持信任,还可能惩罚错对象。生成式AI可提升学习,应构建新评估模型,如展示真实理解等。

DeeplearningAI