「LLM开发」共找到 2457 篇相关文章
AI时代,开发者不能再当 i 人了,「云计算代言人」敬告
亚马逊云科技副总裁 Jeff Barr 时隔 16 年再访中国,对比两个技术时代。他认为 AI 带来创新与挑战,开发者需强大沟通力。还介绍亚马逊云科技工具 Kiro 及新开发模式,预测未来软件开发形态转变。
凌晨三点写代码、10个 Agent 同时跑!ClawdBot 创始人自曝 AI 上瘾史:Claude Code 入坑,Codex 成主力
Clawdbot(现名:Moltbot)爆火,其创始人 Peter Steinberger 分享开发经历。他曾打造 PSPDFKit,后经历职业倦怠。回归后用 AI 编程,从 Claude Code 入坑,Codex 成主力,还分享了 AI 重塑开发方式的见解。
GPT-5仅23.3%,全球AI集体挂科!地狱级编程考试,夺金神话破灭
最新基准测试SWE-Bench Pro评估AI编程智能体,直面真实企业级工程任务。顶尖模型几乎溃败,GPT - 5仅23.3%。该测试解决现有基准数据污染、任务简单问题,能成未来LLM编码能力标尺。
英伟达的AI已经开始接管整个项目了?SATLUTION自主进化代码库登顶SAT竞赛
NVIDIA Research提出SATLUTION框架,将LLM代码进化能力扩展到完整代码库规模,能处理复杂项目。它协调LLM智能体对SAT求解器代码库迭代优化,在SAT竞赛中超越人类冠军,成本低且效率高。
刚刚,全球第一CRM收购AI Agent平台Moonhub
今日凌晨,全球第一CRM平台Salesforce收购AI Agent平台Moonhub,Moonhub团队将加入开发Agentforce。此前Salesforce已收购Informatica,其CEO看好AI Agent,愿景是到2025年底开发十亿个智能体。双方在HR智能体功能各有亮点。
从操作系统到Agent Team,字节Seed 2.0来了!
作者受字节内测邀请,对豆包大模型Seed 2.0进行多方面测试。在APP开发、多模态理解、操作系统构建、Skills调用、真实项目开发等测试中表现出色,虽有小缺点,但整体提升大,值得试用。
从组件到系统,Agent 的 Evaluation 怎么做?
Agentic AI 兴起使 Agent Evaluation 成热点。评估 Agent 与 LLM 有本质区别,Agent Evaluation 要考察系统在动态环境实现目标的综合表现,传统 LLM 评估方法无法沿用。业界涌现 GAIA 等相关工作,评估范式也在不断演进。
软件正在发生根本变化:Andrej Karpathy 旧金山 AI创业学院演讲万字实录
Andrej Karpathy在旧金山Y Combinator AI创业学院演讲,指出软件正进入“软件3.0”时代,大语言模型(LLM)是新型计算机,能用英语编程。他探讨了LLM特性、生态,以及如何利用其构建部分自治产品等。
一粒「扣子」,开启了Agent的全生命周期进化
2025年被视为Agent爆发元年,自年初通用Agent产品Manus出现后,其受关注程度空前。火山引擎Force 2025大会上,升级后的扣子成焦点,它从开发平台进化为全生命周期平台,覆盖开发、框架、调优、协作四大部分。
大模型再爆弱点!旧记忆忘不掉,新记忆分不出,准确率暴降 | ICML'25
弗吉尼亚大学和纽约大学研究人员用「前摄干扰」概念设计测验PI - LLM,测试大语言模型(LLM)上下文检索能力。结果显示,随干扰增加,模型准确率对数下降至零,提示工程效果有限,需调整模型架构或训练范式。