「AI视觉编辑」共找到 10253 篇相关文章

算法论文8

打破长视频理解瓶颈:HoPE混合位置编码提升VLM长度泛化能力

如今视觉语言模型在长上下文任务表现不佳,CMU和小红书团队深入研究,首次提出多模态RoPE扩展策略理论评估框架,指出现有泛化能力不足原因,提出HoPE大幅提升VLM长度泛化能力。

机器之心
新闻资讯8

吴恩达评Agent现状:MCP尚处“蛮荒”,单Agent跑通已是“奇迹”,A2A协作堪称“双重奇迹”

吴恩达与LangChain联合创始人对话,评Agent现状。他认为MCP尚处‘蛮荒’,单Agent跑通不易,A2A协作更难。还谈了Agentic架构、AI系统构建、工具使用、语音技术等,给出创业建议。

InfoQ
新闻资讯7

机器人杭州上演格斗赛!拳拳到肉,宇树CEO王兴兴:创造了人类历史新时刻

全球首个人形机器人格斗赛在杭州落幕,四支队伍用宇树科技G1机器人参赛,“AI测算师”夺冠。比赛分表演赛和竞技赛,考验机器人多方面能力,背后是软硬件协同升级,引发网友热议。

量子位
算法论文8

ICML 2025 | 如何在合成文本数据时避免模型崩溃?

随着生成式AI发展,合成数据成大模型训练重要部分,但可能引发“模型崩溃”。ICML 2025会议上,上交大等团队剖析此问题,提出Token - Level Editing策略,避免模型崩溃,实验验证了其有效性。

机器之心
新闻资讯7

1/8成本比肩Claude 3.7,Mistral Medium 3来了

“欧洲OpenAI”Mistral AI发布多模态新模型Mistral Medium 3,主打编程和多模态理解,成本仅Claude 3.7的1/8,性能达其90%,API已上线,还推出企业聊天机器人服务,引发网友不同看法。

量子位
算法论文8

答对了却没看图?EASE给多模态RLVR装上「视线校正器」

强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。

机器之心
算法论文8

登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球

今年8月,清华赵明国教授团队联合字节跳动Seed等在《Science Robotics》发表论文,提出视觉驱动的反应式足球技能学习框架。该研究历经22年技术接力,成果在真机和赛事中验证,加速进化平台助力研究。

机器之心
新闻资讯7

Zig 创始人直言,Bun 靠 Claude 生成的 Rust 重构版是“没人把关的烂代码”

Bun创建者用Claude智能体11天将Bun从Zig移植到Rust,虽通过测试,但Zig创始人Andrew Kelley批评其编程实践不规范,认为代码是‘没人把关的烂代码’,且AI生成代码缺监督会出问题。

InfoQ
新闻资讯7

“一句话生成游戏”之后:2026 ChinaJoy的四个变化|甲子光年

AI给游戏产业带来新的生产技术,也引发了一场围绕游戏产业新价值链的争夺。本文介绍了2026 ChinaJoy现场正在发生的四个变化,包括游戏开发者的时间被重新分配、游戏引擎开始为Agent重新设计等。

甲子光年
产品应用8

刚刚,“云计算一哥”版龙虾发布,奥特曼打着官司也要云站台

亚马逊云科技发布Amazon Quick,可连接本地文件等,打通生态,还是主动的Agent。奥特曼虽打官司仍云站台,OpenAI与亚马逊云深度合作。此外,Amazon Connect扩展成四个AI解决方案,发布会强调Agent是新企业操作系统。

量子位