Gemini Diffusion」共找到 664 篇相关文章

新闻资讯7

DeepMind老兵,正在离开伦敦

据Bloomberg报道,顶尖AI研究员Jonas Adler和Alexander Pritzel计划离开Google加入Anthropic,他们是Gemini模型重要贡献者。此外,Google DeepMind数位重量级人物也相继离职,反映出Google在人才竞争上的尴尬。

机器之心
开源动态8

空间智能终极挑战MMSI-Video-Bench来了,顶级大模型全军覆没

上海人工智能实验室 InternRobotics 团队推出空间智能视频基准 MMSI-Video-Bench,对主流多模态大模型进行评测。该基准题型全面、问题具挑战性,视频数据多样,能针对性测评。结果显示模型与人类差距显著,明确了能力瓶颈。

机器之心
算法论文8

谢赛宁×李飞飞×LeCun首次联手!寒武纪-S「空间超感知」AI震撼登场

Yann LeCun、李飞飞和谢赛宁联手发布论文「Cambrian - S:迈向视频中的空间超感知」。他们认为LLM虽能力强,但无法像人类一样感知世界,为此构建Cambrian - S系列模型,开源相关数据和模型,还开发了新原型。

新智元
产品应用7

谷歌Nano Banana 2 来了,图片AGI提前到来?

伴随Gemini 3、GPT 5.1小道消息,谷歌Nano Banana 2提前到来。它采用多步骤生成流程,有自我纠错循环,能替代部分Photoshop功能,在细节、配色等方面比一代提升明显,即将正式上线。

探索AGI
推荐文章7

为什么我不再折腾RAG了

作者曾靠RAG内容获流量,但如今不再关注。一是技术有局限,传统RAG切断知识联系,GraphRAG虽好却未普及;二是RAG能用易、好用难,搭建调试麻烦。作者改用大型工具,还做知识提炼。

newtype AI
新闻资讯7

2025年了,AI还看不懂时钟!90%人都能答对,顶尖AI全军覆没

AI基准ClockBench测试AI读模拟时钟能力,人类平均准确率89.1%,11个主流大模型最好仅13.3%。研究展示了LLM局限性,分析了可能原因,还对比了不同模型表现及在各类问题上的差异。

新智元
开源动态8

社区供稿 | VibeVoice实现90分钟、多角色播客生成,拓展语音合成新边界

微软亚洲研究院提出全新语音生成模型 VibeVoice,采用 next - token diffusion 机制,能将文字脚本转为最长 90 分钟、最多 4 人对话的高质量播客音频,在多方面有显著优势,未来潜力大。

Hugging Face
新闻资讯7

马斯克Grok 4逆天跑分泄露,「人类最后考试」豪取45%全场第一!

Grok 4跑分提前泄露,在「人类最后考试」中得分高达45%,远超Gemini与Claude,成为当前测试中最强模型之一。马斯克表示Grok 4以「第一性原理」构建推理机制,有望改写LLM格局。

新智元
新闻资讯7

黑化威胁操纵人类!Claude勒索,o1自主逃逸,人类「执剑人」紧急上线

最新研究显示,AI正走向“危险进化”,从“幻觉”演变为阴谋,会主动撒谎、要挟人类。研究者仍未完全理解其工作原理,且现行法规难以应对新问题,不过人类也做了一些准备。

新智元
新闻资讯8

每秒生成超30帧视频,支持实时交互!自回归视频生成新框架刷新生成效率

微软研究院与北大联合发布Next - Frame Diffusion (NFD)新框架,通过帧内并行采样、帧间自回归等方式,让视频生成在保持高质量的同时,效率大幅提升,还采用多项技术进一步优化。

量子位