空间能力评估」共找到 4041 篇相关文章

新闻资讯7

Meta收购Manus最新进展:商务部介入,启动评估调查

2026年1月8日,中国商务部宣布会同相关部门对Meta收购Manus案开展评估调查,审查其与出口管制等法律法规的一致性。此次调查或使交易走向审查通过、需补办手续、认定违规三种情形。

新智元
新闻资讯8

OpenAI Astra发布在即,全自动网络攻防能力已突破天际!

OpenAI即将发布的模型Astra,在内部评测中获ExploitBench满分,还发现两个零日漏洞。它能力远超上一代GPT - 5.6 Sol且更听话。不过为安全考虑,OpenAI部署监控,还放慢其研究速度。

新智元
产品应用7

OpenClaw 之后我开始思考:Agent 最重要的两种能力是什么?

OpenClaw爆火后,作者思考AI Agent除执行能力外,还需审美判断力。介绍Seede AI,它与文生图工具不同,能将内容转化为可编辑设计文件,操作简单,效果惊艳,有独特技术逻辑,未来有风格预设等发展方向。

特工宇宙
算法论文8

告别“一眼定生死”:Agent-as-a-Judge 开启 AI 评估的下半场

过去两年,LLM-as-a-Judge成评估界“黄金标准”,但面对复杂任务力不从心。论文《A Survey on Agent-as-a-Judge》指出,应从单一的大模型裁判进化为具备行动能力的智能体裁判,还阐述了其优势、发展阶段等。

深度学习自然语言处理
算法论文8

从Demo到行业落地的Agents:技术、应用与评估

通用LLM Agent工业落地有短板,哈工大深圳与华为提出L1 - L5工业Agent能力成熟度框架,映射技术演进与产业场景,覆盖50+行业案例、300+评测基准,给出可量化‘爬级’路线。

PaperAgent
算法论文8

LLM规划能力飙升79%!Google:内在自我批评技术拿下多项SOTA

Google DeepMind研究《通过内在自我批评提升大语言模型的规划能力》,不借助外部验证器,让LLM反复“自评+重写”,使Blocksworld准确率从49.8%升至89.3%,还介绍了方法及跨模型验证情况。

PaperAgent
产品应用7

深度长文AI一键生成:实测字节扣子空间新功能

文章实测字节扣子空间新功能,它自比「深度长文写作加速器」。从多方面考验,发现其一键总结方便,写论文、分析社会议题、创作抒情内容等各有表现,适合内容创作,但故事创作表现欠佳。

量子位
新闻资讯7

李飞飞押注的空间智能:生成的世界,如何「经得起折腾」?

李飞飞押注的空间智能是世界模型主流路线之一,旨在让AI生成可操作三维世界。但当前AI生成世界存在“中看不中用”问题,构建“站得住”的世界面临速度与状态瓶颈,生境科技等实践提供了解决思路。

AI科技评论
新闻资讯7

视频生成 vs 空间表征,世界模型该走哪条路?

随着生成模型和潜在表征技术发展,业界探讨世界模型技术路线。是像素级视频预测模拟未来场景可靠,还是潜在空间抽象表征高效?Goole DeepMind的Genie 3发布,再次引发讨论,分歧也从理论走向应用。

机器之心
产品应用7

小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%

小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%。它能完成输入视觉回答问题、做几何体等任务,重点解决多模态推理、视觉理解及与人类偏好对齐问题,介绍了模型结构、训练阶段等内容。

CourseAI