自动化评估工具」共找到 2870 篇相关文章

推荐文章7

我是微软工程师,编程了30多年,如今我几乎不再编程了

微软资深工程师 Paul Payne 分享编程 30 多年感受,认为 AI 正颠覆软件工程领域。他所在团队研究 LLM 驱动系统,系统从程序员手中接走大量工作,Amplifier 等工具让编程变得更简单,人类程序员价值将升华。

InfoQ
新闻资讯7

刚刚,大模型棋王诞生!40轮血战,OpenAI o3豪夺第一,人类大师地位不保?

国际象棋积分赛成果出炉,OpenAI o3以人类等效Elo 1685分夺冠,Grok 4和Gemini 2.5 Pro紧随其后。Kaggle发布国际象棋文本排行榜,评估模型战略推理等能力,还推出相关数据集,虽有局限但意义重大。

新智元
开源动态8

利用大模型从开源情报中自动提取检测规则:LLMCloudHunter,有开源

随着网络攻击增加,威胁情报成主动安全关键。以色列本古里安大学发布LLMCloudHunter框架,用大模型从开源情报自动生成检测规则,评估显示其规则质量高,且大部分能编译成Splunk查询,软件已开源。

AI与安全
新闻资讯7

近亿元融资落定!隼瞻科技加速芯片设计"敏捷革命"

近日,隼瞻科技完成近亿元天使+轮融资,多家知名战略投资人加入,老股东继续加持。该公司是国内唯一‘IP货架 + EDA工具’双轮驱动企业,自研平台可大幅缩短设计时长,成立三年已迈向规模化落地。

芯师爷
开源动态8

OpenDev:破解AI编程指令衰减难题

当下AI编程工具竞争激烈,大多存在闭源或绑定单一模型的问题。OpenDev是开源的终端AI编程Agent,用Rust编写,仅3.7MB。其论文详细解释设计决策,给出指令衰减问题的工程解法,还有多种实用设计。

CourseAI
产品应用8

真·全民AI健康管家来了!实测蚂蚁AQ:追问识药看皮肤,还能连医院接硬件

蚂蚁上线AI健康管家APP——AQ,有超百项AI功能,连接超5000家医院、近百万医生等。它能追问识药看皮肤,打通硬件,设语音通话。凭借技术和生态优势,实现从技术工具到健康管家的跃迁。

量子位
7

刚刚,Fable 5全球复活!限时7天,额度砍半

Anthropic官宣Fable 5回归,7月1日至7日限时开放,顶配套餐周使用额度砍半。虽更新安全防护,多数编码任务不受影响,但新防护有误伤,且Token消耗快,还拒绝部分正常提问。其自动化率显著提升。

新智元
推荐文章8

当我把 AI 变成一个"算法":Skill 工程化设计的心路历程

作者分享将 Agent 工程化设计的历程。指出 LLM 做 Agent 有痛点,引入 CLI 接管确定性任务和上下文管理,还设计了 Workflow 串联工具,实现自动扩展和无缝互转,最后做 workflow - creator 形成自洽闭环。

腾讯技术工程
产品应用3

Claude Code 桌面版烂爆了,Anthropic 终于把 “100% AI 编码”演砸了

Anthropic将Claude Code做成桌面应用,本值得期待,然而新桌面版却问题频出,如卡顿、崩溃、自动化功能不稳定等,还出现大量基础功能问题。此前Anthropic宣称代码由AI编写比例高,但产品质量堪忧。

InfoQ
开源动态8

让AI看懂科研图表:深势科技开源150万高质量科研图文数据集

深势科技开源OmniScience数据集,含150万个高质量图文对。它利用先进工具攻克图文提取难题,经严格筛选成型,涵盖多学科。还设计重写流水线提升图文语义契合度,基于此训练的模型表现优异。

AIGC开放社区