「智能低模生成」共找到 6108 篇相关文章
打破视觉Token的算力诅咒,RedundancyLens如何为多模态大模型推理减负
多模态大模型的 Decoder - only 架构处理视觉 Token 有计算冗余。合合信息团队提出无需额外训练的动态计算削减方法,在不影响性能前提下降低推理成本,适用于多场景。
谷歌TPU能撼动英伟达吗?前TPU工程师首次揭秘
在AI算力争霸时代,英伟达GPU市值狂飙,但蛋糕正被分食。前谷歌TPU工程师Henry揭秘TPU,从架构、产能、软件等维度分析其优缺点,指出在特定条件下TPU可挑战GPU,未来芯片市场将百花齐放。
告别Sora!从巅峰到黯然离场不到一年半,团队将转向物理AI
2026年3月24日,OpenAI宣布关闭视频生成应用Sora。Sora曾惊艳全球,但因合规麻烦、行业阻击、算力成本高、商业回报低等问题走向关停。团队将转向物理AI,聚焦世界模拟研究。
「被动感知」到「理解接触」!它石智航重磅发布OmniVTA视触觉世界模型
它石智航联合六大顶尖机构推出OmniVTA视触觉操作框架和OmniViTac大规模视触觉数据集。该框架核心是从被动感知到主动预测触觉,通过多模块协同让机器人有预测、理解和修正能力,实验表现优。
Skill制作和使用秘诀!Claude Code工程师的官方宝藏经验
Anthropic工程师发布《Claude Code的经验教训:我们如何使用Skill》教程,介绍Skill是智能体开放标准及在Claude Code的应用,分享制作技巧、类型,还提及分发、管理、组合和衡量方法。
Anthropic工程师都离不开!深夜随手撸出的开源神器,被OpenAl高价收购,23人创业逆袭
昨日 OpenAI 宣布收购 Promptfoo 保障 AI 智能体安全,技术将整合进 OpenAI Frontier。该工具由 Discord 工程师开发,受诸多企业和开发者欢迎。收购后它将保持开源,继续支持现有客户。
最强多模态模型也拿不到30分?DeepImageSearch定义相册搜索新范式,开启个人视觉记忆的深度搜索时代
人大窦志成教授团队联合OPPO研究院提出DeepImageSearch图像检索新范式,将其从“逐张语义匹配”推向“语料库级上下文推理”。团队构建评测基准DISBench,用ImageSeeker框架评测主流模型,结果显示最强模型单次完美解决查询比例不超三成。
拖拽视频编辑进入流式时代!任意时刻、任意内容,实时修改 | ICLR'26
新加坡南洋理工大学和合肥工业大学研究人员在ICLR 2026提出REVEL任务,打造免训练DragStream方法,实现视频生成时实时拖拽编辑,支持多种操作,破解两大难题,实验显示效果、泛化性佳。
Claude杀入Office全家桶,全球4.5亿打工人一夜变天!OpenAI惨烈出局
微软推出办公神器Copilot Cowork,全面接管Office。它内置Claude模型,能执行任务、运行工作流,可处理日程、会议准备等场景。微软采用多模型策略,抛弃OpenAI,Copilot Cowork适合企业,价格较高。
“现在的AI就像1880年的笨重工厂!”微软CSO斯坦福泼冷水:别急着造神
微软首席科学官 Eric Horvitz 在斯坦福商学院演讲,称当下 AI 如 1880 年代刚用电的工厂,底层大模型与商业未契合。他指出模型概率校准不足、医疗 AI 难移植等问题,还谈及人类与 AI 协作及内容溯源等。