「在线时空理解」共找到 960 篇相关文章
一句「你还好吗」值40亿?斯坦福博士出走xAI,押注AGI共情力
AI已足够聪明,却不够温柔。斯坦福博士Eric Zelikman离开xAI,创立Humans&,以40亿美元估值筹集10亿美元,要打造具「情感智能」的模型,让AI学会理解人,资本也开始为「共情」下注。
世界模型有了开源基座Emu3.5!拿下多模态SOTA,性能超越Nano Banana
北京智源人工智能研究院的悟界·Emu3.5是最新最强的开源原生多模态世界模型,能处理图、文、视频任务,在多项权威基准上性能亮眼,还具备理解长时序等能力,背后有技术创新,且选择开源。
卡帕西预言成真!华人团队开源全AI操作系统:神经网络模拟Windows,预测下一帧屏幕图像
大神卡帕西曾预言“AI时代的图形用户界面”,受此启发,华人团队提出NeuralOS,靠RNN和渲染器模拟Windows,能预测下一帧屏幕图像。虽对键盘精细操作处理欠佳,但已开源,有在线体验版。
长得好看又会「看脸色」,这家具身公司不卷「干活」卷「懂你」,天使轮再获数千万战略加注
2026年具身智能转向家庭场景,深穹星核认为面向C端核心是意图理解,推出VLIA模型。其与头部公司合作获意图数据,还与星闪联盟合作推动产品落地,有三层技术护城河,探索长期陪伴机制。
去掉 VAE 之后,商汤用 8B 参数重新定义了开源生图的上限
商汤SenseNova U1开源后引发开发者社区关注,它基于NEO - unify架构,摒弃VAE,实现多模态理解与生成原生统一。在多项基准测试中表现出色,还针对企业办公场景优化,成为生产级任务新选择。
让 Claude/Codex/Cursor 少读文件、多懂代码:Serena 体验
Serena是“编码代理工具箱”,能让LLM像IDE一样理解和改代码,有符号级检索等亮点。适合大型代码库任务,10分钟可上手,有多种接入方式,还有提示词模板,能让AI操作更专业。
治好多模态近视和走神!上海大学去偏干预显著提升模型性能
多模态大模型存在“近视”和“走神”问题,总是过度关注图像底部而忽略核心内容。上海大学与南开大学研究团队用两条数学公式去偏干预,无需增加计算成本,却能显著提升主流模型视觉理解能力。
谷歌云重磅报告:AI智能体接管2026年企业核心工作流
谷歌云基于调研发布报告,揭示2026年重新定义角色、工作流和商业价值的五大关键趋势,如智能体重塑员工、数字化流水线打通企业、全时在线重塑客户体验等,还强调人才技能重塑的重要性。
全球首个世界统一模型发布,机器人家庭成员来了!
自变量机器人发布全球首个世界统一模型架构的具身智能基础模型WALL - B,它打通视觉、听觉等模块,让机器人理解物理世界。还让机器人拥有多能力,通过真实家庭数据形成数据飞轮,助力其融入家庭。
AI搜索优化(GEO):从“被看见”到“被选中”的7个真相!【必看】
白杨SEO分享AI搜索优化(GEO)从“被看见”到“被选中”的7个真相,含为何做GEO、竞争内容、让AI理解和信任品牌的方法、成默认推荐答案的条件、效果评估及长期坚持的原因等。