长程任务能力」共找到 4577 篇相关文章

产品应用8

MiniMax M2.7国服第一!龙虾自我进化,海外开发者疯狂刷屏

MiniMax M2.7发布后在全球开发者社区引发巨大反响,在PinchBench榜单上拿下全球第四、国产第一。它具备多智能体协作、自进化等能力,在代码、办公、科研等场景表现出色,还推出开源项目OpenRoom。

新智元
开源动态8

横扫19项榜单!大晓机器人开源全球首创空间智能底座

大晓机器人联合多机构推出通用基础模型“ACE - Brain - 0”并全行业开源。它打破本体壁垒,在24个核心benchmark中19个获SOTA成绩,应用于机器狗,还提出新训练范式,统一四大能力,重新定义通用具身智能。

AI科技评论
产品应用8

豆包大模型 Seed 2.0,有点不一样

大模型升级频繁令人审美疲劳,但豆包大模型Seed 2.0不同,其核心是Skills调用能力。作者测试了它做的小红书长图文排版生成器和古文翻译器,还体验了APP“专家模式”,展现多模态理解优势。

刘言飞语
开源动态8

开源“裸考”真实世界,国产具身智能基座模型拿下全球第二!

国产具身智能基座模型WALL - OSS在RoboChallenge真机评测榜单获全球第二,多个单任务排第一。它是开源模型,开源程度彻底。还介绍其技术突破及团队情况,强调开源对具身智能发展意义重大。

量子位
开源动态7

Claude Skills彻底火了,真的比 MCP 简单太多了。

Claude Skills在中文社区火了,它解决重复写提示词、token贵及定制难的痛点,可分层加载给上下文窗口减负。它能与MCP组合,官方开源20多个Skill源码,还代表了Agent能力模块化趋势。

探索AGI
开源动态8

VLNVerse“宇宙降临”:吴琦团队交出2025具身导航最终答卷

自2018年吴琦团队发表首篇VLN论文后,领域碎片化问题凸显。2025年末其推出全栈平台VLNVerse,涵盖场景生成、物理模拟、任务基准和通用模型,欲打通Real2Sim2Real,推动VLN向Embodied VLN跨越。

AI科技评论
产品应用7

Google Antigravity vs Claude Code,我觉得还是Claude Code好

作者用相同prompt测试Google Antigravity和Claude Code的代码生成能力。Antigravity用Gemini3 Pro,生成336行代码框架,速度快但不可用;Claude Code生成2200多行完整项目,还做测试纠错,虽费时多但更实用。

AI与安全
开源动态8

长达790年视频镜头,打造原生多模态世界模型!北京智源研究院用Emu3.5统一“世界”

北京智源研究院发布并开源基于原生多模态训练的世界学习者Emu3.5,它将视觉和语言视为同一种数据流,在超13万亿token数据上学习,解决长视野多模态信息处理问题,经多阶段训练和优化,能力强大且已开源。

AIGC开放社区
开源动态8

没想到,32B清华DeepDive掀翻深度搜索全场的!

文章指出大模型在真实深网搜索场景表现不佳,核心矛盾是缺‘难搜’数据和多轮工具调用 RL。清华 DeepDive 用数据合成造‘难搜’题,端到端多轮 RL 训练,在 BrowseComp 刷新开源记录,迁移能力也强。

PaperAgent
产品应用8

谷歌2.5 Image:『你是我的神』,准备丢掉PS了

谷歌新出的大模型Gemini 2.5 Flash Image实现AI图像创作一致性、真实性新高度。它能理解手绘图表、解答问题及完成复杂编辑指令,可在Gemini和Google AI Studio免费使用,表现出色,有望取代很多PS任务

鲸选AI