长文本生成」共找到 2977 篇相关文章

新闻资讯7

字节Seedance 2.0发论文了,171人署名,吴永辉曾妍在列

现象级AI视频技术字节Seedance 2.0在arXiv发论文,公布26页Benchmark和170位贡献者名单。此时它正通过Byteplus平台铺向全球,支持多模态输入。该模型突破瓶颈,评测表现优异,团队近半换血。

量子位
新闻资讯8

斯坦福2026 AI指数报告!中美差距已实质性抹平

斯坦福HAI发布2026年度人工智能指数报告,显示中美在顶级大模型性能上差距已实质性抹平。报告还呈现了AI能力进化、算力格局、智能边界、安全监管、人才流动等多方面情况。

AIGC开放社区
推荐文章8

明略科技吴明辉:企业级Agent的“精度陷阱”与人机协同重构之路

2025 年 12 月 19 日,明略科技创始人吴明辉在 AICon 大会分享《可信 Agent 的规模化之路》。他指出企业级 Agent 存在“精度陷阱”,建议重新设计人机分工,让 AI 执行 Task,人定义目标、校验结果、审计逻辑。

InfoQ
开源动态8

重磅开源!240亿参数力压Nano Banana 2

4月初,京东探索研究院开源JoyAI - Image - Edit图像模型。它是业内首个将「空间智能」写进底层的开源一体化图像模型,能让模型「理解空间,编辑空间」,在电商和具身智能场景极具价值。

新智元
算法论文7

The Batch:927|极速扩散学习

研究表明扩散图像生成器学习重建预训练编码器嵌入可加快训练,Apple团队提出的FAE,通过缩小嵌入再重建解决了因嵌入尺寸大导致的训练受阻问题,性能与先进模型相当且训练更快。

DeeplearningAI
算法论文8

OpenClaw带火AI记忆,DeepMind用混合记忆把3D重建拉到近2万帧

近期,全球爆火的 Agent 私人助手 OpenClaw 接连更新,其期记忆能力获关注。谷歌 DeepMind 联合加州大学伯克利分校提出 LoGeR 架构,将 3D 重建扩展到极序列,在多数据集上表现超越先前方法。

机器之心
新闻资讯8

谷歌AGI底座降临!首个原生全模态嵌入模型上线,已实现全模态SOTA

谷歌发布首个原生全模态 Embedding 模型 Gemini Embedding 2,将文本、图、音视频及 PDF 融于统一向量空间,实现跨模态检索,降低架构成本,赋予 AI 连贯「记忆」,是重塑 AI 基建的里程碑。

新智元
算法论文8

模型声称会“脑补”,结果被论文打脸了?潜在空间想象竟是“摆设”!

多模态大模型中“潜在视觉推理”概念很火,研究者让模型在潜在空间“想象”。但清华和北交学者论文指出,潜在 Token 不关心输入、不影响输出、没信息量。作者提出 CapImagine 方案,效果远超潜在空间方法。

深度学习自然语言处理
新闻资讯8

OpenAI史上最快模型降临,每秒1000Token!代码从此「炸出来」

OpenAI发布GPT-5.3-Codex-Spark,它是专为实时编程设计的超高速模型,生成速度超每秒1000个token,联手Cerebras硬件,重写底座提升性能,在多项测试表现强,ChatGPT Pro用户可尝鲜。

新智元
新闻资讯7

AI产品用户留存仅三个月周期?对话王咏刚:“不和AI协作过项目,你就不是合格程序员” | 万有引力

CSDN&《新程序员》总编对话Mootion创始人王咏刚,探讨AI时代程序员、创业者面临的机遇与挑战。王咏刚认为AI上限是人类平均水平,目前AI应用多为尝鲜用户,产品留存短,未来程序员需与AI协作。

AI科技大本营