「编程评测」共找到 1657 篇相关文章
刚刚,阿里官方认领神秘「欢乐马」,来自ATH郑波团队
周二晚间,AI评测平台Artificial Analysis上,‘欢乐马’空降榜首引热议。现阿里官方认领,它是ATH郑波团队模型,正内测,近期将开放API。其在多项排行榜表现出色,支持四种视频生成模式。
NanoCoder:我把50万行的claude code核心机制浓缩成1000行,不可能学不会了吧!
Claude Code 源码泄露后,kimi Agent 团队何宇峰大佬的 NanoCoder 项目,用 950 行 Python 代码重写其核心机制。它实现 7 种关键设计模式,可助理解顶级 AI 编程 Agent 核心设计,还能按需修改。
Gemini CLI 新升级:深度集成 VS Code,终于不用在终端和编辑器之间反复横跳了
Google发布Gemini CLI重要更新,实现与VS Code深度集成,从架构层面解决AI编程助手的上下文感知问题。新版本有工作区上下文感知和原生差异对比界面两个核心功能,还给出部署要求。
孙正义要用10亿个智能体干掉所有程序员
软银创始人孙正义宣布集团迈入‘人类程序员时代的终结阶段’,计划让AI智能体全面接管编码和编程工作。今年将部署首批10亿个AI智能体,未来会有数万亿个投入使用,且成本低廉。
ICML 2025 | 清华、上海AI Lab提出专家级医学基准MedXpertQA,看o3、R1哪家强
本文由清华和上海AI Lab学者撰写,提出专家级医学基准MedXpertQA。现有医学基准难度和临床相关性不足,而MedXpertQA极具挑战、临床相关性高,构建严格,评测显示前沿模型在医学领域提升空间大。
13.3K Star!终于有人把文档转 Markdown 这件事做好了!
AI 应用普及,企业常将不同格式文档喂给大模型,但转换工具存在诸多问题。Firecrawl 团队的开源项目 anydoc 支持 14 种格式统一转 Markdown,速度快、输出一致,还有浏览器版本保障隐私,提供多种编程接口。
再不怕乱引文献!绕过付费墙,BibAgent把学术核验转为证据链
大模型生成学术论述,其引用验证成难题,尤其付费墙后论文难以核验。BIBAGENT突破此困境,不破解付费墙也能验证引文语义真伪,还构建MISCITEBENCH评测,表现优异,为科学写作补“可审计基础设施”。
吴恩达来信:如何突破产品管理瓶颈
吴恩达指出编程助手带来“产品管理瓶颈”,即决定构建什么成难题。具备用户同理心的产品经理很关键,可凭直觉决策。还介绍通过多种策略获取用户反馈,强调用数据构建用户心理模型做决策。
Cursor SDK正式发布,“cursor” inside!
四月最后一天,Cursor正式发布TypeScript SDK,将智能代理运行时打包成可编程组件,跳出编程工具定义。它提供完整开发套件,支持双模部署,已有公司用其做三件事,还包含关键部分,Composer模型开放有战略价值。
AI安全的过去与未来:从大模型到智能体 | 预约
业界提升前沿AI模型和智能体安全性,常用安全评测和‘安全对齐’技术,但未真正解决风险。本次分享将介绍‘内生安全’探索成果,还公布了相关论文信息,刘东瑞等嘉宾将参与。