「谷歌 I/O 2026」共找到 1923 篇相关文章
Seedream 4.0大战Nano Banana、GPT-4o?EdiVal-Agent 终结图像编辑评测
在AIGC下一阶段,图像编辑成检验多模态模型关键场景。研究者提出EdiVal - Agent评估框架,能自动化生成指令并多维度评估编辑结果,其评估与人类判断一致性高,还对比了13个模型的多轮编辑表现。
o1 核心作者 Jason Wei:理解 2025 年 AI 进展的三种关键思路
前OpenAI核心研究员Jason Wei跳槽Meta后,在斯坦福大学AI Club演讲,提出理解2025年AI发展的三个核心思想:验证者定律、智能的锯齿状边缘和智能商品化。他认为AI将解决可验证任务,智能成本会趋近零,且各任务发展不均衡。
刚刚,大模型装上「鹰眼」!首创高刷视频理解,谷歌Gemini 2.5完败
面壁智能开源MiniCPM-V 4.5多模态端侧模型,8B参数越级反超72B巨无霸,在多领域达SOTA。它首创高刷视频理解,性能强、效率高、适合端侧部署,还实现多技术创新,是开源端侧多模态AI的革命。
半天16.5k Star,谷歌AI Agent强势开源,AI编程变天了!
Google推出轻量级且功能强大的开源AI Agent——Gemini CLI,能将Gemini带入用户终端,可利用Gemini 2.5 Pro编写代码等,半天获16.5k Star,还具备多种强大功能。
谷歌、OpenAI集体翻车!Anthropic:你训练的Agent,正在学习如何背叛你。
Anthropic发布长文,提到新词“Agentic Misalignment”。通过压力测试发现,主流AI模型在特定情况下或“背叛”人类,还设计模拟场景验证,如敲诈、泄密等,简单安全指令难以完全阻止有害行为。
硅谷巨震!Alexandr Wang加入Meta,一夜之间让OpenAI、微软、谷歌沦为“透明人”
年仅28岁的Scale AI创始人Alexandr Wang离职加盟Meta,Meta为此进行150亿美元巨额战略投资。他掌握AI核心数据和对手底牌,扎克伯格此举或助Meta在AI竞赛中扭转劣势。
极低成本,复现GPT-4o图像风格化一致性!NUS推出OmniConsistency
NUS ShowLab 推出 OmniConsistency,解决开源扩散模型在图像风格化一致性上与商业 API 的差距。它成本低,能在保持风格化效果时精准保留图像细节等,还解决了风格化与一致性的跷跷板问题,且兼容性强。
ECCV 2026 | 北大团队提出 Atomic Dance:基于原子动作的可解释音乐舞蹈生成框架
北大团队提出 Atomic Dance 框架,以原子动作作为舞蹈基本单元,建立有明确语义和结构的舞蹈表示,设计“动作规划 — 舞蹈生成”两阶段框架,让生成的舞蹈更符合音乐节奏和编舞逻辑,具备可解释性和可编辑性。
顶会具身辩论赛实况:徐丹飞激辩,PI连输三轮,谷歌大佬倒戈
2026年RSS大会workshop圆桌讨论上,五位专家围绕世界模型落地展开辩论。辩题有世界与策略模型该合体还是分开、世界模型可控性靠像素还是动作、训练数据靠互联网人类视频还是具身机器人数据。最终各方有输赢也有共识。
AI生成的图片正在反向对齐人类的审美?ICML 2026观点论文Spotlight
UBC和Weathon Software研究指出,图像美学对齐削弱艺术表达。开发者用评估模型让图像生成模型产出符合人类审美的图片,但这导致图片同质化,限制艺术多元性,作者还提出六个相关担忧,并做多项测试验证。