通用验证器」共找到 1690 篇相关文章

算法论文8

AI胡说八道这事,终于有人管了?

AI大模型幻觉问题棘手,GPT - 5幻觉率降低。苏黎世联邦理工学院和MATS研究提出低成本、可扩展检测法,精准识别实体级幻觉,分类超现有基准,还能识别逻辑错误,团队已公开数据集。

机器之心
算法论文8

LLM-based Reranker效果到底如何?一项关于SoTA模型的全面分析

在信息爆炸时代,重排序是信息检索系统核心。论文对22种重排序方法实证研究,构建无污染数据集FutureQueryEval。结果显示LLM重排序泛化能力被高估,轻量级模型有优势,为研究和应用提供指南。

深度学习自然语言处理
开源动态8

Kimi K2技术报告正式发布:“保姆级”深度解析,一文读懂万亿参数智能体的所有秘密

Kimi K2技术报告发布,Moonshot团队用万亿+参数稀疏MoE架构等打造接近Claude - Opus的通用大模型。围绕训练稳定性等改进,有预训练、架构设计等多方面创新,为智能体领域提供可行路径。

AI寒武纪
新闻资讯7

Muon作者仅用一篇博客,就被OpenAI看中了

Keller Jordan 2024 年 12 月 8 日发布博客提出用于神经网络隐藏层的优化 Muon,能提升训练速度。他未发论文,称只信速通。其案例显示 OpenAI 重能力。博客对前沿指标描述或过时,Muon 有诸多实证成果。

机器之心
新闻资讯7

烧钱一年,李飞飞的「空间智能」愿景有变化吗?

在a16z主持的访谈中,李飞飞和Martin Casado探讨「世界模型」等话题,重新介绍World Labs愿景。李飞飞指出语言模型描述3D世界有局限,空间智能是关键,公司已推出相关技术和开源渲染

机器之心
新闻资讯7

国内“内卷”没用,企业怎么靠AI出海获利?

InfoQ《极客有约》X AICon 直播探讨中国技术出海破局增长。嘉宾认为企业要判断国内经验能否迁移海外,还分享出海成功案例,给出战略选择建议,如先欧美后国内等,还提及验证产品的关键指标。

InfoQ
新闻资讯8

人类56年解不出,谷歌AI一夜连破9道世纪难题!

Google DeepMind发布全新AI数学智能体AlphaProof Nexus,一次性攻克9道悬而未决几十年的Erdős开放问题,最老的已悬置56年。证明经Lean编译验证,无错误可能。此外,还在多数学分支取得突破。

新智元
算法论文7

从BERT到T5再到Qwen3:关于Embedding的八点总结

哈工大30+页综述聚焦通用文本嵌入(GPTE),系统介绍其架构、数据、模型,探讨预训练语言模型(PLM)给GPTE带来的基础能力与高级扩展,还涉及多模态、多语言、代码嵌入等应用。

PaperAgent
新闻资讯7

AI也能换岗了!Anthropic教智能体交接班,不怕长任务断片

Anthropic设计出长时智能体运行框架,让AI跨越数小时任务渐进式推进。其采用双智能体架构,结合环境管理方法,提升全栈Web应用开发稳定性,但仍有通用与多智能体架构选择等开放问题。

新智元
新闻资讯7

靠创始人亲自假扮AI起家,如今估值10亿美元!印度CEO公开反内卷:从不在10点前起床,也不开例会

人工智能笔记创业公司Fireflies如今估值达10亿美元,但其早期是创始人手工敲击键盘提供服务。其CEO反内卷,让员工远程自由工作。不过早期人工假扮AI参会做法引争议,也有人认为是MVP验证

InfoQ