「全模态大模型」共找到 8872 篇相关文章
专访酷哇杨学:世界模型的下半场,是把一次成功变成长期服务|甲子光年
在2026世界人工智能大会上,具身智能行业关注点从机器人能动转向能否进入真实场景干活。酷哇科技宣布杨学出任首席科学家,共建通用具身智能联合实验室。杨学认为行业应从证明技术转向证明实用,解决机器人在真实场景的长期稳定运营问题。
附部署代码|云数据库RDS 全托管 Supabase服务:小白轻松搞定开发AI应用!
本文展示借助 RDS Supabase 搭建 AI 应用的全流程,对比传统开发,其在效率、成本、扩展性上优势显著。介绍 Supabase 特性、适用场景、核心能力,还给出基于它开发简易 Agentic RAG 应用的步骤。
高性能计算群星闪耀时
文章介绍高性能计算(HPC)对大模型的重要性,回顾中国HPC发展历程,讲述清华高性能所郑纬民等学者贡献,还提及团队在大模型训练、推理、存储等方面成果,以及类脑计算等新探索。
ICCV 2025 | SeaS: 工业异常生成+正常合成+精准掩码大一统框架,指标全面碾压SOTA
华中科技大学慢工团队提出少样本工业生成模型SeaS,依托U-Net,只需1 - 3张训练样本,单模型同步实现多样异常生成、正常产品合成及精确异常掩码标注,突破现有方法局限,在主流数据集上超越SOTA。
Anthropic 在 Claude 内部发现"全局工作空间",可以直接读取模型没说出口的想法
Anthropic发布研究,在Claude内部发现J - space(雅可比空间),即“全局工作空间”,它在训练中自发形成。用雅可比透镜技术可读取其内容,还验证了其功能属性,可用于对齐审计等。
Artificial Analysis 榜单第二,SkyReels-V4 宣告 AI 视频进入「全栈统一」阶段
昆仑天工的 SkyReels-V4 在 Artificial Analysis 文生视频榜单排第二,ELO 评分 1090。它有「运动参考」能力,能覆盖视频创作全工作流,背后靠统一拼接框架和双流 MMDiT 架构,体现 AI 行业「统一」趋势。
谷歌「最强图像模型」横扫一切!3毛钱P图打懵OpenAI,PS要不存在了
谷歌发布顶级图像模型Gemini 2.5 Flash Image,化身nano - banana在LMArena盲测夺冠。它有四大能力,价格低至每张图不到3毛钱,冲击传统P图工具,虽有小瑕疵但应用前景广。
谷歌Genie3全网玩疯!画质飞跃720P,网友造出西幻RPG游戏
谷歌世界模型Genie3发布仅7个多月就有巨大进化,画质达720P,体验时间拉长,世界类型丰富。它玩法多样,能体验极限运动、亲近自然、穿越时空等,网友还用它造西幻RPG游戏。
AI辩论能力碾压人类,81.7%概率让你信服!研究登Nature子刊
《自然·人类行为》研究指出,在线辩论中,大语言模型根据对手特征个性化论点时,比人类更具说服力。实验显示,与GPT - 4辩论的参与者有81.7%更高概率认同其观点,应加强对大模型舆论操控的监管。
ChatGPT转型计划曝光!不再只是回答问题,而是通过穿插使用工具变身行动助手
OpenAI CPO Kevin Weil在访谈中透露,ChatGPT将从回答问题转变为为用户做事,通过穿插使用工具解决复杂问题。当下模型成本已是GPT - 4的500倍,未来将不断降低API价格,还提及模型效率突破关键等内容。