「Thinking with Video」共找到 271 篇相关文章
谷歌IMO金牌级Gemini 3深夜上线!华人大神挂帅,OpenAI无力反击
谷歌DeepMind推出IMO最强金牌模型Gemini 3 Deep Think,以2.5倍暴力性能碾压GPT - 5.1。它在多项基准测试表现出色,已在Gemini App上线。谷歌还将在新加坡组精英团队,由华人科学家Yi Tay率队。此外,Gemini 3 Pro使网页端市占率创新高。
阿联酋K2横空出世,数学、代码样样行,速度全球最快,GPT-4看了都得抖三抖
阿联酋穆罕默德·本·扎耶德人工智能大学与G42公司联合推出开源AI推理系统K2 Think,基于Qwen 2.5 - 32B模型。它靠六项技术性能出众,在多领域测试成绩好,还以小参数量媲美大模型,且全面开源。
开源Qwen一周连刷三冠,暴击闭源模型!基础模型推理编程均SOTA
通义千问卷疯了,Qwen3-Coder刚登场,全新开源Qwen3系列最强推理模型Qwen3-235B-A22B-Thinking-2507又刷新SOTA。一周内,通义千问完成开源三连,在基础模型、编程模型、推理模型方面均达全球开源最强。
非Transformer架构的新突破,液态神经网络的推理小模型只用900M内存
谷歌提出的Transformer架构基本垄断大模型,而初创公司Liquid AI研发的液态神经网络架构另辟蹊径。其发布并开源的LFM2.5 - 1.2B - Thinking模型,仅需900MB内存就能在端侧运行,性能优于Transformer架构模型,还降低了死循环生成比例。
告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式
传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决长视频生成难题,技术已开源。
PyTorch 基金会迎来 Ray 项目,并推出 Monarch 简化分布式 AI 开发
2025 年 PyTorch 大会上,PyTorch 基金会宣布 Ray 项目加入,还推出 PyTorch Monarch 简化分布式 AI 工作负载。大会突显基础模型开发对透明度和可复现性的推动,基金会欲成开放式 AI 基础设施核心枢纽。
拒绝小扎15亿美元offer的大佬,还是加入Meta了
曾拒绝小扎15亿美元薪酬包的机器学习大神Andrew Tulloch加入Meta。他此前在Meta工作11年,后到OpenAI,今年1月随前CTO创立公司,两个月前还拒绝Meta邀约,现入职具体工作未知。
OpenAI深夜甩出GPT-5.1,称更热情,更智能!网友狂吐槽:我不想和它聊天,只想用它工作
OpenAI发布GPT-5.1,包括Instant和Thinking两个版本,称更智能、对话更愉快,还增加“个性/语气”选项。但网友质疑“强化个性”方向,想要高效工具而非“虚拟朋友”。
剪映前AI产品负责人创业多模态Agent,做懂上下文的007乙方,成立半月融资数百万美元
剪映前AI产品负责人廖谦创业,成立极致上下文公司,获数百万美元投资。公司首要打造面向营销场景的多模态Agent,中长期搭建AI信息表达系统,他认为当下是创业好时机,且无传统意义上的护城河。
ICML 2026 |让大模型边想边说:这篇文章把「何时开口」变成可学习策略
论文《When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning》针对推理模型的‘沉默税’问题,提出Side - by - Side(SxS)Interleaved Reasoning,将‘何时披露内容’变为可学习决策,经实验验证效果良好。