「一念 LLM」共找到 1985 篇相关文章
中国首次实现运载火箭一级陆地回收,朱雀三号“站着”回来了!
今早7时35分,蓝箭航天朱雀三号遥二运载火箭升空,一子级约6分钟后成功陆地回收,二子级将卫星送进预定轨道。这是中国首次实现重复使用运载火箭一子级着陆腿方式陆地可控回收。
《动手写AI Agent》50 行代码,你的第一个 Agent
文章教你用50行代码打造能读文件、跑命令、自主决策的AI Agent Ling。介绍用JSON Schema给LLM装工具,通过循环让LLM按需调用工具,还给出运行示例及与Claude Code的对照。
北大团队发布首篇大语言模型心理测量学系统综述:评估、验证、增强
随着大语言模型(LLM)能力迭代,传统评估方法难满足需求。北大宋国杰教授团队论文首次系统梳理LLM心理测量学研究进展,革新评估原则,扩展测量构念与方法,还给出增强方法与未来研究方向。
如何“驯服”你的Agent?这可能是你见过最优雅与可控的Agent框架 | 深度体验
文章聚焦对话式Agent,指出LLM不确定性是企业应用Agent的障碍。介绍Parlant框架,它用ABM方法控制交互,能降低LLM负担、处理边缘场景。还通过构建10086客服助手展示其使用,最后与LangGraph对比。
AI短漫剧的Netflix来了!恒星AI推出全球首个影视级AI Agent「Starfilm」,打造AI短漫剧制作的“超级梦工厂”
恒星AI推出全球首个影视级AI Agent「Starfilm」,能一站式完成AI短漫剧创作。它集剧本、数字人、音乐等核心能力,还搞“星光计划”助力创作者在多平台分发变现,让“一人成剧”梦想成真。
Remix 3终结以React为中心的架构
多年来,React 一直是全栈 JavaScript 架构基础。但 Remix 3 挑战了这一局面,它遵循渐进式增强和服务器优先原则,将 Web 基本原理置于核心,重新定义构建方式,引发对 React 中心架构的思考。
GPT-5仅23.3%,全球AI集体挂科!地狱级编程考试,夺金神话破灭
最新基准测试SWE-Bench Pro评估AI编程智能体,直面真实企业级工程任务。顶尖模型几乎溃败,GPT - 5仅23.3%。该测试解决现有基准数据污染、任务简单问题,能成未来LLM编码能力标尺。
英伟达的AI已经开始接管整个项目了?SATLUTION自主进化代码库登顶SAT竞赛
NVIDIA Research提出SATLUTION框架,将LLM代码进化能力扩展到完整代码库规模,能处理复杂项目。它协调LLM智能体对SAT求解器代码库迭代优化,在SAT竞赛中超越人类冠军,成本低且效率高。
比Vibe Coding强100倍!字节 Trae 2.0 携“上下文工程”登场:一句话,从需求干到上线!
字节跳动的AI编程助手Trae发布2.0版本,新增SOLO模式,可实现从想法到应用的一站式交付。上下文工程领域热度攀升,该概念因Andrej Karpathy推动而爆火,Trae迭代快,已建立完整能力体系。
从组件到系统,Agent 的 Evaluation 怎么做?
Agentic AI 兴起使 Agent Evaluation 成热点。评估 Agent 与 LLM 有本质区别,Agent Evaluation 要考察系统在动态环境实现目标的综合表现,传统 LLM 评估方法无法沿用。业界涌现 GAIA 等相关工作,评估范式也在不断演进。