「目标识别」共找到 804 篇相关文章
让大模型学会「心灵感应」:基于思维沟通的多智能体合作范式来了
NeurIPS 2025的论文提出思维沟通概念,建立潜在思维可识别性理论,构建ThoughtComm框架。该框架让模型共享潜在思维,跳过语言冗余歧义,实验显示其提升了协作效率与推理能力,或开启新智能形态。
一杯咖啡,3亿美金!斯坦福天才少女退学创业,Meta AI大牛排队加入
2024年,斯坦福博士生Carina Hong与前Meta AI研究员交谈后,退学创办Axiom Math,目标打造「AI数学家」。公司首轮融资6400万美元后估值3亿美元,吸引Meta等公司顶尖AI人才,虽面临竞争,但前景广泛。
EMNLP2025 | 探究大语言模型的语言共享神经元提升低资源语言能力
论文提出BridgeX - ICL方法提升LLM低资源语言性能,通过三步实现优化。构建两类探测数据解决传统问题,识别重叠神经元,用HSIC选最优桥梁语言,在多任务实验验证其有效,揭示多语言机制规律。
0.07B大败QwenVL72B!百度开源OCR3.0"三件套"
OCR 历经四次范式迁移,工业落地存在精度与参数量等矛盾。百度开源 PaddleOCR 3.0“三件套”,含 PP - OCRv5、PP - StructureV3、PP - ChatOCRv4,各有创新点,解决了多语种识别、版面还原等问题。
对话经济周期大师拉斯·特维德:AI 创造了万亿价值,但在统计上,你我可能都因它而“变穷”了
本文是对经济周期大师拉斯·特维德的访谈。他与他人合著《超智能与未来》,写作中大量用AI。他认为AI如工业革命,虽创造巨大价值,但面临能源挑战,且经济周期仍会存在,还探讨了AI对社会各方面的影响。
PDF难点解析:处理复杂表格、水印、印章、复选框、信息抽取等7项任务,6大能力
文章介绍Nanonets - OCR - s可处理关键信息提取、视觉问答等7项任务,具备LaTeX方程识别、图像描述等6项能力,还给出体验链接。但测试发现英文体验优于中文,模型有重复输出、幻觉严重问题。
他们还没毕业,就在用AI搭建自己的世界|五源小酒馆Vol.30 x AI Native创造者
本期五源小酒馆邀请三位年轻AI Native创造者,分享AI学习与创造经历。他们谈及AI对生活工作的改变、关注的产品及模型,探讨资源分配、AGI突破等问题,还交流了未来能力培养和给十年后自己的话。
人大-清华-腾讯发布:音频 - 视觉多模态任务统一框架
人大、清华和腾讯合作发布Crab论文,目标是实现多模态场景理解任务的高效一统。它针对音频 - 视觉理解模型难点提出解决方案,构建数据集、设计LoRA结构、统一架构,训练分预训练和指令调整两阶段。
AI Pin 们折戟后,第二代 AI 硬件闷声发了大财
过去两年,第一代AI硬件喊出‘杀死智能手机’口号,赚足目光。当下,创业者不再将取代手机作为目标。第二批AI硬件‘边界感’强,专注细分场景,同时,科技巨头正布局全新AI层,‘隐形OS’雏形已现。
腾讯WorkBuddy联名硬件来了!首批100多家伙伴入场
9月2日腾讯WorkBuddy开放平台上线,亮相9款联名智能硬件、30多个行业应用与超100家生态伙伴。其是国内AI Agent赛道首个打通三层生态的开放平台,目标是成「面向Agent时代的操作系统」。