隔离环境」共找到 518 篇相关文章

算法论文8

6款小游戏难倒所有顶级VLM!愤怒的小鸟让它们全军覆没,性能不如随机猜测

淘天集团未来生活实验室提出首个系统性评估多模态大模型(VLM)交互式物理推理能力的综合基准DeepPHY。它集成六个物理环境,对17个主流VLM测试,揭示其在物理交互等方面短板。

量子位
推荐文章7

明明程序员这个岗位是很适合女性,可女程序员数量怎么这么少?

文章指出程序员岗位适配女性,如靠脑力、环境好、重实力等。但现实中女程序员少,原因包括从小被贴标签、职场存在隐形歧视、家庭责任的阻碍,呼吁职场兼顾理性与感性。

开源先锋
新闻资讯7

OpenAI 又发布了一个新的AI Agent~

OpenAI发布新AI Agent Aardvark用于找代码漏洞,流程包括监控Git提交等,测试能发现92%已知漏洞。还公布AI浏览器Altas技术架构,采用进程隔离和IPC通信,启动快,但维护成本高。

探索AGI
产品应用7

Claude Code发布Agent View,多任务流的ADHD患者有救了

Claude Code发布Agent View,它像给Claude Code的tmux,能将多个Claude会话状态分类展示,帮用户分配注意力。它把Anthropic内部工作流产品化,有会话与窗口解绑、工作树隔离等设计。

花叔
开源动态8

Qwen-AgentWorld:一个语言世界模型,模拟七大Agentic领域

今天正式发布 Qwen-AgentWorld,它是首个原生语言世界模型,能在七大领域模拟智能体交互环境。同步发布 AgentWorldBench 评测基准。Qwen-AgentWorld 经三阶段训练,在评测中表现出色,还探索两种范式增强通用智能体能力。

千问大模型
新闻资讯7

图灵也没想到,智能,必须在现实中「活」下来

第六届 ATEC 科技精英赛 ATEC2026 已开赛,由多单位共同组织。赛事聚焦人工智能、具身智能等方向,以真实世界挑战为命题,通过赛题设计检验系统在真实环境的运行能力,还设置丰厚奖励。

机器之心
开源动态8

美团智能体SOTA模型LongCat-Flash-Thinking-2601开源

美团龙猫团队开源智能体推理模型LongCat - Flash - Thinking - 2601,总参数5600亿。该模型在多方面有卓越表现,团队通过构建数据、模拟环境、采用强化学习策略及设计高效架构等,使其比肩闭源模型。

AIGC开放社区
7

刚刚,Claude 推出记忆功能,比ChatGPT 好用

Anthropic为Claude推出引用过往对话新功能,向部分用户开放,其他用户也将很快获得。它能搜索和引用历史对话,与ChatGPT记忆功能不同,是按需检索,检索原始内容,还能隔离工作与个人内容。

AGI Hunt
开源动态7

从科学论文自动生成视频

该项目解决学术演示两核心问题,用智能体PaperTalker生成视频,还设Paper2Video基准评估。介绍了PaperTalker使用步骤,含环境、配置、推理,也说明了Paper2Video评估指标及运行方法。

GitHubStore
新闻资讯7

Databricks与OpenAI合作:企业级私有化GPT-5来了

OpenAI和Databricks深度合作,将把GPT - 5等模型原生集成到Databricks平台。企业可在自有数据环境运行模型,通过SQL等调用,Mosaic AI Gateway保障数据安全,多家企业表示期待。

AI工程化