「人类式思考」共找到 2305 篇相关文章
ICCV2025 | 多视图生成新范式-利用自回归模型探索多视图生成
本文介绍自回归生成多视图图像方法 MVAR,能从先前视图提取引导信息增强一致性,拉近与基于扩散方法的图像质量差距。解决了多模态条件控制和数据有限问题,展示出强指令遵从与多视角一致性。
颠覆搜索引擎,下一代Agentic Deep Research!12家顶尖学术机构联手提出
在信息获取方式变革背景下,12家顶尖机构联合发布论文提出Agentic Deep Research,它由大模型驱动,可自动规划检索路径等,或颠覆传统搜索范式,且有基准成绩和TTS Law支撑,开源生态也在聚焦。
Labubu后,一款AI“毛球”潮玩火了:朱啸虎押注,定价399元开售就卖爆
国产AI潮玩Fuzozo(芙崽)618预售爆火,首轮10分钟破千单。它获朱啸虎等投资,主打18 - 35岁女性客群,有五行性格设定,具多模态交互与养成陪伴功能,还构建了独特技术体系。
The Batch:831 | 机器翻译正在实践中发挥作用
人工智能为语言学习应用巨头 Duolingo 带来生产力提升,借助生成式 AI 构建 148 门课程,总量翻倍。其 AI 辅助课程构建法能快速转化多语种版本,还在评估多模型,不过此举也引发批评。
Lex Fridman 对谈谷歌 CEO:追上进度后,谷歌接下来打算做什么?
Lex Fridman 采访谷歌 CEO Sundar Pichai,探讨谷歌在 AI 竞赛中的逆袭、搜索和广告的 AI 模式转变、模型发展、AI 编程提效、AR 前景、自动驾驶挑战等,还谈及 AGI 及 AI 对人类的影响。
港科联合港中文提出AdaCtrl,自适应可控Reasoning,可降10~90%
港科联合港中文提出AdaCtrl,解决LLM推理的过度思考、算力浪费和响应延迟问题。它有自适应和用户控制两种模式,通过两阶段训练法实现目标,实验效果好,未来或拓展到多领域。
ICML25 | 让耳朵「看见」方向!仅依靠360°全景视频,就能生成3D空间音频
空间音频技术成提升沉浸式体验关键,但现有技术未充分利用360°全景视频空间信息。OmniAudio研究可直接从360°视频生成空间音频,相关代码和数据集已开源,虽有局限但前景好。
AI辅助编码将如何改变软件工程:更需要经验丰富的工程师
文章指出生成式AI改变软件开发方式,LLM在编码领域成果显著。但AI辅助编码有局限,如‘70%问题’。还介绍有效模式,提及软件工程智能体兴起,最后认为未来对经验丰富工程师需求或增加。
Reasoning的最终答案可能不是模型想要的答案!
大型语言模型解决复杂问题有推理过程和答案,传统评估只看最终答案。论文提出最终答案可能不佳,中间步骤更值得研究。还介绍通过切割推理过程发现中间步骤藏玄机,提出‘分步检查法’提升模型表现,实验表明准确率最高提升13%等。
奥特曼最新深度访谈:AI至今没有iPhone时刻!
OpenAI首席执行官山姆·奥特曼在深度对谈中复盘大模型发展,谈及砍掉Sora和自研浏览器聚焦平台,认为AI缺iPhone时刻,还分享ChatGPT决策过程、创业经历,提出从成功学经验等观点,反驳末日论。