视觉 - 语言推理」共找到 3237 篇相关文章

推荐文章7

Karpathy:别再问AI「你怎么看了」,这是错误的提示词策略!

Andrej Karpathy提出不要把大语言模型看作实体,应视作模拟器。他建议探索话题时避免用‘你怎么看’提问,给出‘什么样的一群人适合探索,他们会怎么说’的更优策略,还指出不同领域影响有别。

AI寒武纪
算法论文8

NeurIPS 2025|CAKE:大模型驱动的贝叶斯优化新配方,让黑箱优化更智能、更高效

香港中文大学(深圳)等高校研究人员提出 CAKE 方法,被 NeurIPS 2025 接收。它利用大语言模型动态设计高斯过程核函数,构建自适应贝叶斯优化框架,在多领域实验中效果优,还具备可解释性。

机器之心
算法论文8

6款小游戏难倒所有顶级VLM!愤怒的小鸟让它们全军覆没,性能不如随机猜测

淘天集团未来生活实验室提出首个系统性评估多模态大模型(VLM)交互式物理推理能力的综合基准DeepPHY。它集成六个物理环境,对17个主流VLM测试,揭示其在物理交互等方面短板。

量子位
开源动态8

2M大小模型定义表格理解极限,清华大学崔鹏团队开源LimiX-2M

语言模型在结构化表格数据处理上表现不佳,清华大学崔鹏团队开源的 LimiX-2M 模型,仅 2M 参数,却能同时支持分类、回归等任务,性能超越经典模型,且训练、运行成本低,科研友好。

机器之心
开源动态8

2.5K Star 牛皮项目,512MB内存就能跑,树莓派、旧电脑秒变专属云桌面!

介绍开源Web桌面操作系统ArozOS,它由香港开发者tobychui为低功耗设备设计。始于2016年,用Go语言编写,在Github获2.5K star。功能强、资源占用低、易安装,能让旧设备变个人云桌面。

开源先锋
推荐文章7

舍弃 VAE,预训练语义编码器能让 Diffusion 走得更远吗?

纽约大学谢赛宁团队、清华&快手 Kling 团队的研究者指出 VAE 制约当前 Diffusion 范式,提出用预训练视觉模型作语义编码器改进。介绍了 VAE 不足及 RAE、SVG 工作如何解决问题,将扩散模型从‘压缩优先’转为‘语义优先’。

机器之心
算法论文8

别再只关注KV Cache了! LLM稀疏性新洞察:为何模型越深越稀疏?UNCOMP从矩阵熵给出答案

团队论文UNCOMP获EMNLP 2025主会接收,它提出高效推理框架,从截断矩阵熵视角解释LLM深层稀疏现象。还能识别关键结构、找到最优压缩策略,设计的UNCOMP框架优化KV Cache,实验效果佳。

深度学习自然语言处理
推荐文章8

Sam亲自泼冷水,GPT-5意外失手:我们对AI的期待,是否已被整个行业误判?

科技行业集体转向 AI,高管强调其变革性,可 OpenAI 的 Sam Altman 却泼冷水,提醒投资者高估回报。文中围绕‘AI 是否放缓’展开讨论,还分析了 GPT - 5 发布遇冷原因、AI 对就业影响等,指出 AI 发展多且快,未来潜力巨大。

InfoQ
算法论文8

仅100种子题,合成数据质量超GPT-5,阿里、上交提出Socratic-Zero框架

阿里巴巴与上交大联合提出 Socratic-Zero 框架,仅从 100 个种子问题出发,通过三智能体协同进化生成高质量课程。该框架合成数据质量超 GPT - 5 等,Solver 性能提升显著,工程友好,开启零数据自进化新路径。

机器之心
推荐文章8

《AI大模型时代老板必修课》

阿里云蒋林泉与钛媒体刘湘明在云栖大会展开《AI大模型时代老板必修课》对谈,围绕企业AI落地多方面关键议题交流。探讨了CIO角色进化、AI业务价值界定、企业战略制定等内容,为决策者提供实践指南。

阿里云开发者