视觉思维链推理」共找到 2705 篇相关文章

产品应用7

抢疯了!AI宠物翻译器:800多块,预售2万单

PettiChat宠物翻译器售价800多,预售2万单。它能将猫狗叫声转成句子,翻译延迟1.2秒,还具备位置追踪、安全警报和声音克隆功能。其靠大模型的声音识别和情绪推理系统实现翻译。

量子位
算法论文8

多模态大模型别盲目刷题!诊断-生成-强化闭环,找准盲点 | ICML'26

多模态大模型训练常采用‘题海战术’,存在能力诊断不精准、视觉内容缺乏扩展等问题。北大和山大团队提出DPE框架,通过‘诊断-生成-强化’闭环提升模型能力,实验效果显著,还强调训练应具备诊断能力。

新智元
新闻资讯8

哈佛《Science》研究:大模型已碾压人类医生!

哈佛医学院等团队让OpenAI o1系列大模型与数百位医生在多项测试中较量,大模型在各项诊断和管理推理任务上全面超越人类专家,不过当下模型处理非文本信号有局限。

AIGC开放社区
算法论文8

ICLR最佳论文:Transformer天生简洁

2026年ICLR最佳论文对Transformer做深度思维体检,指出其架构真正威力在于描述概念时比RNN等简洁指数级甚至双重指数级,但验证其内部逻辑计算成本高昂,为解释其能力开新窗。

AIGC开放社区
新闻资讯7

The Batch: 941|盲人辅助模型中的隐患

视障患者用AI评估外貌引发关注。失明记者Milagros Costabel撰文探讨用视觉语言模型作“虚拟镜子”的挑战与隐患,如AI会给出评判性反馈,心理学家担心这加剧抑郁焦虑。产品应提供客观解读。

DeeplearningAI
推荐文章8

大佬深度解析:Coding Agent的底层运行逻辑是什么?

本文由AI领域知名学者Sebastian Raschka撰写,探讨编码智能体及其编排的设计、工作原理和组件协同。指出智能体周边支撑系统重要性不亚于模型本身,详细阐述编码智能体六大核心构建模块。

机器之心
推荐文章8

龙虾安全被3层硬核架构焊死了!一份面向开发者的硬核生存指南

随着OpenClaw等高权限智能体应用爆发,AI自主性与失控的赛博博弈开启。文章从源头对齐、边界重构、结果保障三个维度,拆解适应智能体自主行动时代的新型安全框架,为开发者提供生存指南。

量子位
推荐文章7

如何塑造软件公司的工程文化

David Grizzanti 在演讲中提出塑造软件公司工程文化的方法,认为应像人类学研究般先了解文化,明确行为奖惩区间,再通过建立新规范、以身作则逐步转变文化,还分享运用人类学思维理解文化的方式。

InfoQ
新闻资讯7

内存股集体大跌,原因竟是谷歌这篇一年前的论文

美国内存股集体暴跌,诱因是谷歌新博客介绍一年前公布的技术 TurboQuant。它是压缩算法,可大幅减少 LLM KV 缓存内存占用、提升速度且精度零损失,有望打乱市场对内存芯片增长预期。

机器之心
推荐文章8

英伟达GPU全系列硬核科普手册:一文读懂NVIDIA芯片的定位、规格与应用场景

这是英伟达GPU全系列硬核科普手册,覆盖消费级、工作站、推理卡、训练卡及中国特供版五大产品线,讲清区别与用法,还介绍架构演进、命名规则等,助读者秒变选型高手。

腾讯技术工程