训练细节」共找到 2351 篇相关文章

开源动态8

智源开源EditScore:为图像编辑解锁在线强化学习的无限可能

北京智源研究院团队发布 EditScore 高保真奖励模型系列,为图像编辑强化学习提供精确奖励信号。团队提出两步解决方案,开发出 EditScore 系列模型,其在多方面表现优异,还验证了两大应用场景,有深刻研究洞见。

机器之心
算法论文7

AI能否「圣地巡礼」?多模态大模型全新评估基准VIR-Bench来了

来自日本高校和企业团队提出多模态大模型评估基准 VIR-Bench,用于评测 AI 对旅行视频中地理位置与时间顺序的理解。它将任务拆解,构建数据集,实验显示模型虽有改进但性能远未达标,指明了大模型进化方向。

机器之心
7

这个开源工具让AI理解你正在操作的任何界面,俩学生辍学开发的产品,功能超多。

Everywhere是两个学生辍学开发的开源交互式AI助手,能感知屏幕内容,在任意界面使用。它功能多、细节优,支持多场景,集成多种AI模型,使用简单,还提供个性化体验。

开源AI项目落地
推荐文章8

2025 年 InfoQ 趋势报告:AI、ML 和数据工程

InfoQ AI ML 趋势报告基于编辑团队与嘉宾播客,总结 AI、ML 技术发展趋势。涵盖 AI 代理、多模态语言模型等创新领域,也提及早期采用者、早期多数、晚期多数类别的技术,还对 2025 年相关领域发展作出预测。

InfoQ
产品应用7

Thinking Machines 发布 Tinker,重新定义 LLM 微调的边界

Thinking Machines 发布工具 Tinker,它是灵活的语言模型微调 API,采用‘责任分工’模式,让研究者专注算法创新,不用被运维细节拖累。此模式获 Karpathy 赞赏,目前 Tinker 开始内测,理念受欢迎。

AI工程化
开源动态7

DeepSeek突然拥抱国产GPU语言!TileLang对标CUDA替代Triton,华为昇腾Day0官宣支持适配

DeepSeek v3.2开源TileLang版本算子引关注,其可对标CUDA替代Triton,还适配国产算力生态,华为昇腾官宣支持。TileLang由北大团队主导,提供不同层次编程接口,助DeepSeek提升性能。

量子位
推荐文章8

对谈 Macaron 创始人陈锴杰:RL + Memory 让 Agent 成为用户专属的“哆啦 A 梦”|Best Minds

本文访谈 Macaron 创始人陈锴杰,探讨 RL+Memory 让 Agent 发展及 Macaron 产品。他强调 RL 在 Agent 开发重要性,介绍 Macaron 定位、特点、训练方式,还谈及社区设想、RL 应用及产品发展方向等。

海外独角兽
算法论文8

不愧是中国机器人,乒乓打得太6了

清华姚班本科生苏智团队在论文中提出结合模型规划与强化学习的分层框架,让宇树G1机器人实现亚秒级反应下的稳定连续对打,在真实实验中击球和回球率高,还能连打106拍。

量子位
开源动态7

强化学习+MCP=王炸?开源框架教AI在MCP中玩转工具解决任务,实测效果超越GPT!

科技公司OpenPipe提出全新开源强化学习框架MCP·RL,只需一个MCP Server地址,agent就能自动发现工具、生成任务,在闭环反馈中摸索出最优调用策略,实测在2/3的benchmark上达或超SOTA性能。

量子位
新闻资讯7

Agent创业者的天塌了,OpenAI发布ChatGPT Agent

昨晚OpenAI发布ChatGPT Agent,这让Agent创业者紧张。它整合多种能力,功能强大,支持多操作。新模型经强化学习调优,在多基准测试中表现佳,或挤压初创公司通用Agent赛道空间。

花叔