代码即公司」共找到 3463 篇相关文章

算法论文8

都在卷「让大模型多循环几遍」,这个7B模型LoopCoder v2说:多循环 1 次就够了

一项新研究表明,7B小模型LoopCoder v2在正常计算外多循环一次,就能在SWE - bench Verified基准上大幅提分。继续增加循环次数,性能反而下降。研究还算了‘收益 - 成本’账,给出选择循环次数的诊断方法。

AIGC开放社区
产品应用7

Claude有「编制」了!Anthropic发的

6月23日,Anthropic发布Claude Tag,它是常驻Slack频道的AI团队成员,有自己的身份、账号和审计轨迹。其核心是权限架构,采用智能体身份,按用量计费,已对企业版和团队版客户开放beta。

新智元
新闻资讯8

刚刚,OpenClaw和Cursor杀入手机!Agent从此塞进口袋

OpenClaw和Cursor同日发布原生App,OpenClaw上架全血原生App,可无缝交互,解锁设备底层能力;Cursor发布iOS应用公开测试版,可让开发者在手机上指挥代码开发,重塑人类工作方式。

新智元
新闻资讯7

Anthropic员工离职创业,估值10亿美元,也做「递归自我改进」

Anthropic离职员工Behnam Neyshabur和Harsh Mehta创立Mirendil公司,获2亿美元种子轮融资,估值达10亿美元。目标是构建工具平台,让科研团队自主训练AI模型,采用递归自我改进技术。

机器之心
新闻资讯7

卡帕西Anthropic最新头衔:技术员工(MTS)

卡帕西在Anthropic头衔为技术员工(MTS)引关注,不止他,很多大佬加入Anthropic和OpenAI职级都是MTS。MTS年薪可观,其制度有防猎头、促文化认同等好处,但也被指有‘粉饰’之嫌。

量子位
新闻资讯8

20美元,扒掉AI安全底裤!智能体2小时,攻破160亿美元巨头

红队安全创业公司CodeWall的AI智能体,花20美元Token费、运行2小时,自主选麦肯锡为目标,攻破其「数字大脑」Lilli,获4650万条聊天记录等读写权限,暴露AI安全隐患。

新智元
算法论文8

DMLR 2026 | RPI Shaowu Pan(潘韶武)团队 Nithin Somasekharan等:CFDLLMBench——首个面向计算流体力学的大语言模型综合基准评测

文章介绍针对CFD领域的综合LLM评测基准CFDLLMBench,构建三层递进挑战体系。实验揭示主流LLM在‘知道’与‘做到’间有差距,多智能体框架可提升成功率,代码与数据集已开源。

力学与人工智能
新闻资讯7

为了训练AI,Meta强制监控了员工的鼠标和键盘

近日,Meta宣布在美国员工电脑装追踪软件,记录鼠标、键盘操作及截取屏幕内容,用于训练AI。这引发员工愤怒,Meta CTO称员工无法退出。Meta AI投入大,此举或因缺训练数据,但也被质疑是在训练替代者。

DeepTech深科技
新闻资讯7

跑分第一,推理暴跌!Claude Opus 4.7上线48小时口碑崩了

Claude Opus 4.7发布48小时口碑两极撕裂。官方榜单并列全球第一,但逻辑推理公开测试成绩暴跌,token消耗涨35%,旧接口报错,用户吐槽「更贵、更蠢、更爱顶嘴」,Anthropic虽解释却难平用户怒火。

新智元
新闻资讯7

The Batch: 940 |Claude Mythos Preview 引发安全担忧

Anthropic为将推出的Claude Mythos Preview采取特别预备措施,因其会带来网络安全风险。该模型能力强大,能发现众多代码漏洞。Anthropic组建联盟增强防御,其表现也优于多个知名模型。

DeeplearningAI