「编程评测」共找到 1658 篇相关文章
刘鹏飞组提出Agent领域的少即是多:智能不在于数据堆砌,78个样本训练出超强Agent,128倍效率提升
刘鹏飞组论文《LIMI: Less is More for Agency》提出颠覆性观点,认为Agent智能培育关键在数据质而非量。LIMI用78个样本在AgencyBench得分超基线模型,实现128倍数据效率提升,为Agent开发提供新路径。
Claude正式登陆Xcode
Xcode 26更新对Claude原生支持,将AI编程助手融入代码编辑器。开发者可在Xcode用Claude加速开发,有代码助手和编码工具等功能,订阅机制合理,还给出启用方式。
Hinton万万没想到,前女友用ChatGPT跟他闹分手
Hinton在接受采访时爆料前女友用ChatGPT和他分手。访谈中他分享AI观点,认为人类应让AI成母亲,还谈到用ChatGPT研究、问修理问题等,也纠正从谷歌离职原因。
首个基于 MCP 架构的低代码 RAG 框架
检索增强生成系统复杂度提升,科研人员面临高昂工程成本。清华大学等联合推出 UltraRAG 2.0,基于 MCP 架构,降低复杂 RAG 系统技术门槛与学习成本,支持低代码构建复杂系统。
OpenAI和Anthropic罕见互评模型:Claude幻觉明显要低
OpenAI和Anthropic罕见合作,互相授予API权限评估模型安全与对齐情况并发布报告。双方派出多模型参与,从指令层次、越狱、幻觉、欺骗策略等方面评测,呈现各模型优缺点。
一场「狼人杀」,考倒了一堆大模型
南开大学等机构设计 InMind 评测框架,在 Avalon 游戏对 11 个前沿大模型测试。多数模型停留在表层模仿,仅少数推理增强模型有初步‘风格敏感性’,未来人机交互应关注‘像不像’。
全球开源大模型,前十五名全是中国的
近日,随着新一代大语言模型更新,开源大模型成热门话题。Design Arena排行榜上,若设定为“开源”,前15名均为国产开源大模型,排名第一的是DeepSeek - R1 - 0528 ,智谱、阿里等厂商多款模型上榜。
用了60天Claude Code,我的Vibe Coding终极指南:从0到1的正确打开方式
作者分享使用Claude Code 60天的经验,用多个案例展示其将AI编程从辅助推向自主的能力,还给出Vibe Coding方法论、工作流等,提醒别被工具束缚,技术为人服务。
拆箱开源版Coze:Agent核心三件套大公开,48小时揽下9K Star
扣子两款子产品扣子开发平台和扣子罗盘近期开源,加上此前开源的开发框架Eino,覆盖了Agent开发全链路。其采用宽松的Apache 2.0开源协议,降低开发门槛,有望带动Agent在更多场景落地。
谷歌AI Agent刚开源!多任务智能体+MCP+谷歌搜索,狂揽9000颗星
今天凌晨,谷歌在官网开源AI Agent框架Gemini CLI,将Gemini大模型融入终端。它能调用视频和图像模型,集成MCP、谷歌搜索等功能,还集成超强编码助手,刚开源就在Github超9000颗星。