gemini-2.5-flash-image-preview」共找到 3708 篇相关文章

算法论文8

中国团队让AI拥有「视觉想象力」,像人类一样脑补画面来思考

上海交通大学等团队提出 Thinking with Generated Images,让大模型像人类一样用「脑内图像」推理。该研究区分三种视觉思维模式,提出核心技术框架,解决视觉推理局限,实验效果好,未来有望在多领域突破。

机器之心
产品应用7

Cursor自研模型反超Opus 4.6!价格脚踝斩,氛围编程沸腾了

Cursor新编程模型Composer 2性能超Claude Opus 4.6,价格“脚踝斩”。它靠引入新强化学习方法,让模型学会“做笔记”突破上下文瓶颈,在任务中表现出色,研究员还放出Composer 3消息。

量子位
算法论文8

警告:你的Agent可能无法"解决"真实世界的视觉问题

文章提出 AgentVista 评测基准,含 209 道任务,横跨 7 大领域 25 个子方向。评测 14 个主流模型,最强的 Gemini - 3 - Pro 准确率仅 27.27%,揭示多模态 Agent 在视觉理解、工具调用等方面挑战大。

深度学习自然语言处理
产品应用7

Cursor发布首个编程大模型!代码生成250tokens/秒,强化学习+MoE架构

Cursor 2.0正式发布,搭载自研大模型Composer。它30秒完成复杂任务,比同行快400%,每秒生成250个tokens。还带来原生浏览器工具等新功能,基于强化学习,但模型底子透明度遭质疑。

量子位
开源动态8

开源AI教育视频生成神器,3Blue1Brown风教学动画一键搞定!

新加坡国立大学Show Lab团队开源Code2Video,能让代码变高质量教育视频,逻辑是用代码驱动视觉效果。它有智能解析等特性,可解决传统教学视频形式单一等问题,应用场景广泛。

开源星探
开源动态8

The Batch: 855 | 为智能体而生

总部位于北京的 Moonshot AI 发布 1 万亿参数的 Kimi K2 系列大语言模型,包括预训练和微调版本。它输入输出能力强,架构独特,在多基准测试领先,支持工具调用,多家服务商已集成。

DeeplearningAI
新闻资讯7

小扎开建「人类第一算力帝国」!26年榨干当地水电,27年超越星际之门

Meta进军AI超算领域,扎克伯格宣布2026年启用1GW「Prometheus」集群,2027年建成占地如曼哈顿的「Hyperion」计划部署超5GW级算力,Meta还将自建天然气电厂,力抗OpenAI与马斯克。

新智元
产品应用7

用户太蠢不配用 Fable?被Anthropic的回应气笑了:最贵的模型,最憋屈的体验

Anthropic推出Fable 5,有限时优惠但价格贵,新回退机制引争议,很多请求被降级。其曾强调安全,却用隐蔽方式编码用户信息,引发开发者不满,与OpenAI竞争也面临挑战。

InfoQ
算法论文8

人类画了100年的脑图,AI仅用几小时!还绘制出新脑区

加州大学旧金山分校团队提出CellTransformer算法,几小时完成5只小鼠脑图谱绘制,还绘出新脑区。该算法能准确对齐已知脑区,可扩展到多动物数据集,未来有望用于人类大脑及其他器官研究。

量子位
推荐文章7

告别工具焦虑:2026年真正值得用的8款AI效率外挂

文章指出2026年是‘AI深度融合’元年,工具使用进入‘重塑工作流’阶段。作者筛选出Gemini全家桶、OpenCode等8款‘硬核’AI工具,介绍其特点和优势,如多模态、不设限、易用等。

鲸选AI