免真值评估」共找到 811 篇相关文章

产品应用8

写顶会LaTeX论文的门槛彻底被谷歌PaperOrchestra打下来了~

谷歌推出多智能体协作框架PaperOrchestra,能将非结构化研究素材转化为符合顶会要求的LaTeX投稿论文。它解决了现有自动化研究框架在论文写作环节的问题,实验显示全面超越现有基线。

PaperAgent
算法论文8

CVPR 2026 | 还在为AI「鬼画符」发愁?TextPecker即插即用破解文字渲染难题

在生成式AI浪潮中,视觉文本渲染仍是未攻克的核心难题。华中科技大学白翔教授团队等提出TextPecker,是基于结构感知的即插即用型强化学习优化策略,可适配主流生成器,提升视觉文本渲染性能,已被CVPR 2026接收。

机器之心
开源动态8

超20万个高质量Skills!浙大等联合推出SkillNet,告别孤立Skill实现自进化

浙江大学联合多家机构推出开源基础设施SkillNet,拥有超20万个高质量Skills。它能让AI智能体告别失忆式工作,将互联网资源和人类经验转化为可执行Skills,构建Skills网络,经严苛评测,在真实场景验证了强大实战能力。

AIGC开放社区
新闻资讯7

龙虾之父参与的首个OpenAI项目:@开源贡献者,ChatGPT token费送

OpenAI推出Codex for Open Source项目,由‘龙虾之父’Peter Steinberger宣传。该项目为开源贡献者费送ChatGPT token,可申请API积分、费用6个月ChatGPT Pro等,申请门槛不算高。

量子位
算法论文8

北大、字节、中科院自动化研究所等提出图像并行生成新范式

北大、字节等团队发现多模态模型先思考后作画会降低图像语义保真度,因自回归架构有误差传播问题。为此提出并行多模态扩散框架MMaDA - Parallel,构建ParaBench基准,多项优化后在测试中击败Bagel。

AIGC开放社区
推荐文章7

听说,大家都在梭后训练?最佳指南来了

大模型时代,Scaling Law 边际效益递减,业界转向后训练。《Post-training 101》博客可助初学者入门,涵盖从预训练到指令微调、SFT 原理、多种强化学习技术及模型评测方法等内容。

机器之心
开源动态8

狂涨20.8K star!GitHub 官方出品,强烈推荐!

介绍开源项目 `GitHub Desktop`,它基于Electron开发,用TypeScript编写并使用React框架,支持Windows和Mac,集成常用Git操作,有直观图形界面等特色,助开发者轻松使用Git,目前获20.8K star。

开源先锋
开源动态8

腾讯开源智能体构建框架

腾讯开源智能体构建框架 Youtu-Agent,灵活高性能,验证性能出色,开源友好成本低。有自动智能体生成等亮点,适用于不同用户群体,涵盖研究、开发等场景,还介绍核心概念,附项目地址。

GitHubStore
新闻资讯8

OpenAI和Anthropic罕见互评模型:Claude幻觉明显要低

OpenAI和Anthropic罕见合作,互相授予API权限评估模型安全与对齐情况并发布报告。双方派出多模型参与,从指令层次、越狱、幻觉、欺骗策略等方面评测,呈现各模型优缺点。

量子位
新闻资讯7

GPT-5、Grok 4、o3 Pro都零分,史上最难AI评测基准换它了

AAI机构提出新基准FormulaOne,让GPT - 5、o3 Pro等前沿大模型集体得零分。该基准含220个图结构动态规划问题,分三类难度。测试结果显示,模型在深层及最深层难度表现差,引发关注。

机器之心