工作方式重塑」共找到 2023 篇相关文章

新闻资讯7

说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。

作者有感于AI在真实工作场景评测的稀缺性,以阿里国际站RealReplicaBench评测集为例,介绍电商场景任务,发现多数模型成功率低,其他领域类似,呼吁厂商努力,作者也计划自跑评测更新排名。

数字生命卡兹克
新闻资讯7

AI正在偷走白领工作!OpenAI狂砸10亿教AI上班,你的完美继任者即将上岗

Anthropic、OpenAI等大厂计划每年投10亿美元,为AI提供强化学习环境、让其「偷师」专家,教会AI像人类一样工作。OpenAI高管预言未来经济或成「RL机器」,引发岗位替代担忧。

新智元
产品应用8

智谱GLM-5.1深度评测:8小时连续工作,开源大模型进入"工程交付"新纪元

2026年4月8日智谱发布GLM-5.1,它是全球首个通过真实工程任务验证8小时持续工作能力的开源模型,在SWE-Bench Pro上超越GPT-5.4等登顶。该模型性价比高、技术创新多,还适配国产硬件,开源生态友好。

机器学习AI算法工程
算法论文8

Anthropic 在 Claude 内部发现"全局工作空间",可以直接读取模型没说出口的想法

Anthropic发布研究,在Claude内部发现J - space(雅可比空间),即“全局工作空间”,它在训练中自发形成。用雅可比透镜技术可读取其内容,还验证了其功能属性,可用于对齐审计等。

AI工程化
算法论文8

DeepSeek又又又又发新论文了!这一次,他们重构了AI看图的方式

DeepSeek发布论文DeepSeek - OCR 2,指出传统AI看图方式有误,提出视觉因果流概念。其两阶段级联推理解法效果显著,还可能整合进即将发布的DeepSeek V4,有望实现原生多模态。

花叔
开源动态8

阿里杀进Agent上下文战场:钉钉聊天、企业文档、工作数据终于要被Agent吃进去了

个人、企业用户苦工作场景「上下文」久矣,Agent常不懂真实业务。阿里千问办公开源的「MyContext」,将分散工作数据加工成Agent可消费的上下文,处理多种难题,还将能力向组织延伸,助力Agent融入工作流。

量子位
新闻资讯8

从美国能源部“创世纪计划”看 AI for Science:走向更完整的科学闭环与科研组织方式重构

近日,美国能源部公布“创世纪计划”首批入选资助谈判项目名单,反映AI for Science深刻演变,从理论探索走向实际应用,科研组织方式也在重构。本文从多维度拆解名单背后的战略布局与演进趋势。

力学与人工智能
新闻资讯8

刚刚,OpenAI发布GPT-5-Codex:可独立工作超7小时,还能审查、重构大型项目

凌晨1点,OpenAI发布针对编程优化的GPT-5-Codex,它能独立工作超7小时,可审查、重构大型项目。还宣布Codex升级,包括新CLI和IDE插件等,同时介绍安全保护措施、价格及可用性。

机器之心
新闻资讯8

Anthropic 深夜祭出 Claude Sonnet 4.5,能自主连续工作 30 小时!CEO:它更像你的同事

昨夜凌晨,Anthropic 推出新一代模型 Claude Sonnet 4.5,官方称其是世界上最好的编码模型等。它能自主连续工作 30 小时,还同步推出多项产品功能更新及 Claude Agent SDK 开发工具包。

AI前线
产品应用8

GPT-5.2全力出击!碾压44类专业工作,实测编程同价位无对手、深度推理封神,但速度太拉胯了

GPT-5.2登场,有即时版、思考版与专业版。它在多方面大幅升级,能碾压44类专业工作。经济性强,编程能力佳但速度慢,还自评‘最优科研模型’,幻觉现象减少。今日起推送,优先面向付费用户。

InfoQ