「复杂推理任务」共找到 4091 篇相关文章
谷歌Nano Banana Pro上线,深度结合Gemini 3,这下生成世界了
谷歌最新图像生成模型Nano Banana Pro(Gemini 3 Pro Image)上线,结合Gemini 3 Pro强大推理与知识,在控制力、文字渲染和世界知识方面升级,能生成高分辨率、一致性强图像,还支持创意操控、多语言文本生成等,多产品将上线。
EMNLP 2025 | T2R-bench: 业内「首个」工业级表格生成报告评测基准
中国电信人工智能研究院推出业内首个面向真实工业场景的“表格到报告”基准T2R-bench,涵盖多领域真实表格、问题与人工标注关键点,配套创新性三维度评测体系。实验显示主流大模型在该任务上表现欠佳,提升空间大。
The Batch: 872 | 机器藏羚羊混入羊群
中国科学院联合云深处科技等,将云深处科技的 X30 型四足机器人伪装成藏羚羊,引入可可西里保护区藏羚羊群,在不打扰它们的情况下进行观察。该机器人适应复杂地形和极端环境,还能跟踪羊群并传输数据。
视觉+语言+动作!超强具身“训练宝典” EmbRACE-3K
视觉 - 语言模型在具身环境中表现有局限,港大推出 EmbRACE - 3K 数据集应对。它含 3000 多个任务、2.6 万个决策步骤,有细致多模态注释。团队用其微调 Qwen2.5 - VL - 7B 模型,还建立新基准评估多个模型。
刚刚,OpenAI正式发布o3-pro!奥特曼激动更新博客:温和的奇点
今日凌晨,OpenAI发布o3-pro,Pro订阅用户可通过ChatGPT和API使用。其在多项任务表现出色,但在ARC-AGI数据集上与o3相近且成本高。网友测试评价不一,此外OpenAI CEO奥特曼还发表博客展望AI未来。
高精度全身操控!从文本输入生成全身操控物体的动作
物体操控的整体动作生成是具广泛应用但极具挑战的任务,核心挑战在于手部与身体协调及关节式物体操控精度。香港大学提出协同扩散噪声优化框架CoDA,优化三个专用扩散模型,还采用BPS统一表示提高交互精度。
这一夜,中国AI彻底翻身了:DeepSeek R1让全世界刮目相看 | 深度评测
作者深度测试新DeepSeek R1,发现其代码生成能力超Claude 3.7,虽编程全面性有不足,但已处Claude 3.7与Claude 4之间。前端设计审美达Claude 4水准,部分方面略胜,有自主学习推理能力,或改变中国AI历史。
2025-04-努力不是做好事情最重要的因素
作者分享个人生活、工作等多方面情况,提及播客发布,认为努力非工作做好的关键因素,深入探讨Agent在业务应用中的问题,还谈及视频更新、投资经历等,最后表示要审视目标、精简事务。
在三张圆明园鼠首照片里,我们看到了3D AI的Harness时刻
作者通过三张圆明园鼠首照片开展实测,验证了全新3D AI Harness工作流:通用Agent调度任务、专业3D模型生成、专业软件后处理,仅1.47元即可生成可编辑可交付的3D资产,探讨了3D AI行业的新发展路径。
突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA
OpenAI首颗自研芯片Jalapeño「墨西哥辣椒」实测成绩亮眼,AI推理性能超英伟达全系,功耗仅为一半。它从设计到流片仅用九个月,得益于GPT - Astra协助。有观点认为CUDA护城河或已死,OpenAI正打造算力版图。