「三维场景生成」共找到 3869 篇相关文章
谷歌、OpenAI集体翻车!Anthropic:你训练的Agent,正在学习如何背叛你。
Anthropic发布长文,提到新词“Agentic Misalignment”。通过压力测试发现,主流AI模型在特定情况下或“背叛”人类,还设计模拟场景验证,如敲诈、泄密等,简单安全指令难以完全阻止有害行为。
多模态推理新基准!最强Gemini 2.5 Pro仅得60分,复旦港中文上海AILab等出品
现有多模态大模型benchmark对逻辑推理理解不足,复旦大学等单位提出MME - Reasoning评估其推理能力。对30 + 模型评测,最优得分仅60%左右,反映出模型多方面推理短板。
清华给电子显微镜加上Agent,DeepSeek V3全程调度,数天流程缩短至几分钟
清华大学牵头,联合多机构推出电镜领域AI Agent AutoMat,它能把原子级STEM图像转成标准CIF结构并给出关键物性,将人工流程缩短至几分钟。它还构建数据集验证,性能超现有工具,不过也有瓶颈待解决。
字节跳动开源文档解析大模型Dolphin,告别繁琐的文档处理,上线狂揽1k星,真是绝了!
字节跳动开源文档解析大模型Dolphin,采用两阶段分析 - 解析范式,有异构锚点提示等功能,适用多领域。技术架构基于视觉 - 编码器 - 解码器,训练集超3000万个样本,安装推理简单,比同类更具竞争力。
南开 && UIUC | SearchAgent-X,打破「效率瓶颈」,让复杂「AI搜索智能体」走向现实
南开大学和伊利诺伊大学厄巴纳 - 香槟分校的研究提出SearchAgent - X框架,解决大型语言模型驱动的搜索智能体效率痛点。它剖析制约效率的原因,通过两大‘加速引擎’优化性能,实验显示效果显著。
「神经软件」正在到来,人类代码将失去意义!
Lambda Labs CEO Stephen Balaban 在英伟达 GTC 2025 提出神经软件概念,指不再写代码,让大语言模型成软件。它没传统软件的 bug 问题,未来计算机或端到端神经化,虽有争议,但变革在加速。
ACL 2025 高分接收 | 高感情语音技术:逻辑智能小语种TTS破局之道
语音合成技术在大语种发展好,但小语种因语料稀缺等面临挑战。逻辑智能团队提出针对低资源语言TTS的解决方案,构建泰语数据集,经先进预处理,其TTS模型效果好,有零样本克隆能力。
预测误差仅0.26mm,中科院自动化所×灵宝CASBOT团队让机器人提前“知道你要干嘛”
中科院自动化所与灵宝CASBOT提出DTRT方法获ICRA 2025录用。该方法利用Transformer和博弈论,将人类动态纳入长期预测,实验显示其预测精度和协作表现显著优于现有技术,有巨大应用潜力。
斩获20K星!再见PDF排版噩梦,这个开源神器让文档处理爽到飞起!
MinerU是上海人工智能实验室推出的开源数据提取工具,能将多模态文档解析为Markdown,支持精准提取图片、表格、公式,具有多语言支持、高性能等特点,应用场景广泛,还开源免费。
AI 领域新动向!持续思考模型CTM横空出世:AI 向生物智能迈出重要一步
Sakana AI 推出新型 AI 模型 CTM,重新引入「时间」和「神经元动态」到 AI 计算核心。它有诸多创新,在迷宫探索、图像识别等任务表现出色,虽有训练慢等不足,但为 AI 向生物智能迈进提供新思路。