多码本视觉表示」共找到 934 篇相关文章

算法论文8

多模态大模型别盲目刷题!诊断-生成-强化闭环,找准盲点 | ICML'26

多模态大模型训练常采用‘题海战术’,存在能力诊断不精准、视觉内容缺乏扩展等问题。北大和山大团队提出DPE框架,通过‘诊断-生成-强化’闭环提升模型能力,实验效果显著,还强调训练应具备诊断能力。

新智元
新闻资讯7

“没有一张卡是空的”,阿里腾讯加码,算力军备进入“抢购下半场”

5月13日,腾讯和阿里巴巴释放AI算力投资加码信号。腾讯业绩增长,资本开支增加,高层称下半年采购提速;阿里CEO吴泳铭表示服务器算力利用率近极限,投资回报确定,支出或超3800亿。产业呈现三重新趋势。

芯师爷
新闻资讯7

剧情反转!马斯克牵手 Dario,Anthropic 与 SpaceX 罕见合作

Anthropic官宣与马斯克的SpaceX合作,将使用其超算集群全部算力。因Claude火爆致宕机,Anthropic急需算力。其估值疯涨,而SpaceX闲置算力出租也符合商业逻辑,马斯克还对Anthropic团队表示认可。

AGI Hunt
新闻资讯8

深度访谈:阿里云X平头哥,模型推理提升13倍背后的秘密

这篇深度访谈聚焦阿里云与平头哥,探讨模型推理提升13倍背后的秘密。随着AI焦点转向推理,行业面临算力、成本、监管等矛盾。嘉宾分析推理范式现状与变化,探讨推理加速技术及优化策略,还谈及瓶颈、未来发展及竞争方向。

InfoQ
新闻资讯7

The Batch: 941|盲人辅助模型中的隐患

视障患者用AI评估外貌引发关注。失明记者Milagros Costabel撰文探讨用视觉语言模型作“虚拟镜子”的挑战与隐患,如AI会给出评判性反馈,心理学家担心这加剧抑郁焦虑。产品应提供客观解读。

DeeplearningAI
开源动态8

登顶全球权威榜单!浙大创业团队百卡打造开源实时世界模型,视频秒变可交互4D世界

全球科技界正豪赌「世界模型」,但主流模型多停留在「视觉生成」。中国影溯公司发布并开源世界模型 InSpatio - World,综合性能优异,以小博大登顶权威榜单,降低了物理世界数字化门槛,引发行业关注。

机器之心
新闻资讯8

奥特曼宣判Transformer死刑! AGI两年内降临,下一代架构已在路上

奥特曼在访谈中表示未来将有全新底层架构取代Transformer,还称AGI两年内降临,编程智能体是下一个引爆点。他回忆OpenAI草创期,还给出诸多判断,“后Transformer”竞赛也已打响。

新智元
产品应用8

2秒终结AI 3D不可能三角,我们和VAST首席科学家曹炎培聊了聊

速度、质量、管线可用性是AI 3D生成的不可能三角。VAST发布的Tripo P1.0首次在原生三维空间概率生成,2秒输出专业3D资产,效率提升百倍,生成结果可直接用于多场景,突破了这一困境。

机器之心
新闻资讯8

OpenClaw创始人:80%的应用会消失,花哨的AI工作流只会生产垃圾,工程思维才是超能力

OpenClaw创始人Peter Steinberger表示,OpenClaw这类AI助理将取代手机上80%的应用。他分享OpenClaw诞生过程,其能远程修复Bug等。他还批判花哨AI工作流,认为人类品味不可或缺,建议学习AI要去玩。

AI寒武纪
新闻资讯7

奥特曼点名「AGI最后一块拼图」!记忆,才是硅谷2026新共识

2026年,AI竞争焦点从Scaling转向记忆。奥特曼押注记忆,预计ChatGPT产品线未来一年有进展。AI记忆能力成新共识,提升其记忆成巨头竞争核心,不过距完善记忆系统还远。

新智元