多模态内容」共找到 1707 篇相关文章

算法论文8

MIT成果登Nature正刊:90天,「AI科学家」完成3500次电化学测试

美国麻省理工学院李巨团队在Nature发表论文,展示多模态机器人平台CRESt。它结合多模态模型驱动的材料设计与高通量自动化实验,大幅提升催化剂研发速度和质量,还解决了实验结果可重复性不足问题。

新智元
产品应用8

Sora 2瑟瑟发抖!通义万相2.5放大招:一句话出1080P电影,音画精准同步

云栖大会上通义万相2.5系列模型亮相,包含四大模型,视频生成模型实现音画同步突破,降低电影级视频创作门槛。它创作能力全方位升级,支持多种模态输入,采用原生多模态架构。

新智元
新闻资讯7

AI杀死了破折号,也绞杀了语文。

互联网上破折号“暴毙”,因被无数人当成AI接头暗号。很多社媒平台上AI写的内容用蹩脚符号,人类苦AI内容久矣。为区分AI,人类或放弃部分文化表达,这是表达降级,AI正绞杀语文。

数字生命卡兹克
算法论文7

大模型“记性差一点”反而更聪明!金鱼损失随机剔除token,让AI不再死记硬背

马里兰大学等团队提出金鱼损失法,训练时随机剔除部分token,让模型不逐字记内容,仍学语言规律。实验显示,LLaMA - 2用该方法后记忆内容减少,下游任务性能影响小。

量子位
产品应用7

WorkBuddy杀疯了?一群AI专家帮我打工,我在微信里当赛博虾工头!

本文介绍腾讯推出的全场景职场AI智能体桌面工作台WorkBuddy。它内置多领域垂类专家,能接管自媒体内容创作流水线,还接入微信ClawBot插件方便操作。部署和技能配置门槛低,内置主流模型,还有免费Credits福利。

量子位
算法论文8

北大、字节、中科院自动化研究所等提出图像并行生成新范式

北大、字节等团队发现多模态模型先思考后作画会降低图像语义保真度,因自回归架构有误差传播问题。为此提出并行多模态扩散框架MMaDA - Parallel,构建ParaBench基准,多项优化后在测试中击败Bagel。

AIGC开放社区
算法论文8

相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作

S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。

量子位
开源动态8

10B超越Gemini-2.5-Pro!阶跃星辰端侧多模态天花板开源

阶跃星辰多模态智能团队开源STEP3-VL-10B多模态模型,仅100亿参数却性能惊人。它采用了独特的架构、训练策略与推理机制,在多任务上表现出色,为小模型发展提供新思路。

AIGC开放社区
产品应用7

一晚上,用AI干了7个PPT,我发现了一个让PPT设计师失业的方法

作者一晚用AI做7个PPT,分享让PPT设计师失业的方法。介绍苹果风格PPT效果,阐述10分钟搞定专业PPT的核心步骤,还对比了传统与AI方式的时间成本,最后预告下期分享内容

AI 产品自由
推荐文章8

百度端侧大模型安全建设实践:在算力与保障之间找到平衡

在 QCon 全球软件开发大会上,百度李志伟分享端侧大模型安全建设实践。介绍其发展趋势、优势与应用场景,指出面临隐私、内容等安全挑战,阐述云端与端侧安全方案,通过案例展示优化效果,展望未来安全建设方向。

InfoQ