空间智能评测」共找到 4206 篇相关文章

开源动态8

AI4S又一瓶颈被攻克:两个AI「吵架」,让科研代码部署成功率突破95%

科学软件大多难直接运行,制约AI4S与Agentic Science发展。Deploy - Master应运而生,是一站式自动化工作流。Search Agent筛选工具,Build Agent用双模型辩论机制使部署成功率超95%,为科学智能体交互打基础。

量子位
产品应用8

Nano Banana Pro最全解析,设计师和开发者都用得上,附官方提示指南

Nano Banana Pro基于Gemini 3 Pro构建,将逻辑推理能力注入像素生成,解决画面准确性、逻辑性问题。它在多方面实现飞跃,应用广泛,谷歌还给出提示词使用技巧,但在部分处理上仍有提升空间

AIGC开放社区
算法论文8

美团LongCat扎扎实实做了件难事:LLM数学新天花板AMO-Bench

美团LongCat团队联合高校推出AMO - Bench,用50道原创奥赛级难题评估LLM数学能力。它解决现有基准测试痛点,经四重把关构建,测试显示顶级模型表现不佳,也揭示模型提升空间大。

PaperAgent
新闻资讯7

第八届 「GAIR 全球人工智能与机器人大会」即将启幕:穿越AI长夜,共睹群星闪耀

2025年12月12 - 13日,第八届GAIR全球人工智能与机器人大会将在深圳举办。大会设三个主题论坛,聚焦大模型、具身智能等议题,有青年与前辈交流,还有海内外学者、产业界人士参与,也关注算力赛道。

AI科技评论
新闻资讯8

刚刚,OpenAI Sora 2重磅登场!首个APP上线,或将成为AI时代新TikTok

凌晨1点,OpenAI推出Sora 2,AI视频迎来「GPT - 3.5时刻」。它物理智能提升、实现音画同步,人物一致性等刷新SOTA。Sora App上线或重塑短视频交互与社区互动,还在安全治理上布下多层防线。

新智元
算法论文8

AI修Bug新SOTA:SWE-Bench Lite60.33%修复率,像人一样能积累经验,中科院软件所出品

ExpeRepair是中科院软件所团队推出的仓库级缺陷修复系统,模拟人类认知的情景和语义两种记忆模式,能积累经验。在SWE - Bench Lite评测中,其Claude - 4+o4 - mini组合修复率达60.3%居首。

量子位
算法论文8

让GUI Agent不再「边做边忘」:快手、浙大提出MemGUI-Agent,攻克长程GUI任务

手机GUI Agent在长程任务中易遗忘关键信息,浙江大学APRIL实验室和快手主站技术部提出MemGUI - Agent,核心是ConAct,将上下文管理变为Agent动作,还开源MemGUI - 3K数据集,模型在评测基准取得佳绩。

量子位
新闻资讯7

OpenAI 全面拥抱 Agentic-First,实测有点扎心

OpenAI发布GPT - 5.6系列,Sol定位长周期Agent,训练目标转向Agentic - First。但目前难以用上Sol,且其评测数据因计数规则差异大,还出现变身话痨、少说话和干完活难兼顾的问题。

CourseAI
产品应用8

原生Agent杀入画布!一站式搞定专业创作,全程可控、不抽卡

国内RunningHub平台推出原生AI智能体全能内容创作平台RHTV,它能一站式搞定专业创作,流程可控。实测显示,它能编排短剧、生成商用物料,还内置影视级工具,且依托庞大生态,能力无上限。

量子位
新闻资讯8

OpenAI推出GPT-5.4 mini/nano;MiniMax发布M2.7;小米发布MiMo-V2系列模型

OpenAI、MiniMax、小米陆续发布新模型。OpenAI推GPT - 5.4 mini与nano,优化速度和成本;MiniMax的M2.7能自我演化;小米MiMo - V2系列覆盖智能体核心、全模态理解和情感语音合成。

AIGC开放社区