「通用泛化」共找到 1061 篇相关文章
OpenAI 高管凌晨发飙:「有人闯进我们家偷东西了!」
Meta CEO扎克伯格从OpenAI挖走四名高级研究人员,OpenAI首席研究官Mark Chen凌晨发飙,称像有人闯进家偷东西。Meta以1亿美元签约奖金挖角,OpenAI积极应对,还反思公司方向。
DPO与GRPO谁更胜一筹?港中文、北大等联合发布首个系统性对比研究
港中文、北大等团队首次全面对比DPO和GRPO算法在自回归图像生成中的应用,评估其在域内、域外性能,探究奖励模型及扩展策略的影响,为开发高效RL算法提供新思路。
文生图进入R1时代:港中文MMLab发布T2I-R1,让AI绘画“先推理再下笔”
港中文MMLab团队发布首个基于强化学习的推理增强文生图模型T2I - R1。它提出双层级CoT推理框架和BiCoT - GRPO强化学习方法,解决生成评估难题,为多模态生成提供新范式。
别再乱调图像塔了!浙大 IJCAI 论文揭露 VLM 非对称性真相,给 CLIP 微调「踩刹车」
浙大陈静远教授课题组等提出自适应非对称适配器,放弃对图像分支硬性微调,引入预测置信度自动给视觉塔‘踩刹车’。经实验总结出微调三大核心洞察,在多个数据集测试中表现优异。
OpenAI搬空Claude Code!用户家当一键进Codex,唯独带不走Claude
AI编程大战中,OpenAI盯上对手用户的配置、技能等“家当”。8月11日其统一外部智能体导入说明,可将Claude Code等工具配置等搬入Codex,但只能进不能出,且部分内容无法迁移。
具身智能的「ChatGPT时刻」还没到,科沃斯先把机器人拆开了
科沃斯将旗下具身智能机器人“八界”开源,成立“八界开源智创空间”,开放从硬件到底层系统的使用权限。该机器人由轮式底盘加机械臂构成,科沃斯董事长钱东奇不看好人形及VLA技术路线。
AI 剪完整条视频,却没看过一帧:背后是所有 agent 都在用的套路
browser - use团队开源的video - use项目能让Claude自动剪辑视频,且AI不看视频帧,靠处理文本完成。这是当前聪明的agent产品通用做法,还给出判断AI agent的三个问题及思路。
给 Agent Skills 装上眼睛:MMSkills 用多模态技能包教会智能体看状态、做决策
上海交通大学和小红书团队推出面向通用视觉 Agent 的多模态技能框架 MMSkills,将可复用技能扩展为多模态程序性知识,通过 branch loading 调用视觉证据,在 GUI 与游戏任务评测中表现出色。
英伟达叫板DeepSeek?怒投260亿美元,要打造最强开源模型
英伟达已成为人工智能时代基础设施的一部分,2023年11月推出首个Nemotron模型进入通用大模型领域。未来五年将投260亿美元构建开源模型,还发布了性能最强的开源模型Nemotron 3 Super。
评论送书 | Al智能体与传统AI应用的区别?它如何工作?如何快速构建智能体?
文章对比AI智能体与传统AI应用,指出前者更像“乐高积木”,可融入生活工作。介绍其工作是“感知—推理—执行—学习”循环,还给出快速构建通用方法,如明确目标、选框架等。