「科研工程」共找到 1046 篇相关文章
为老父亲做的桌面 Agent,不小心在 GitHub 霸榜一周
OpenHuman是TinyHumans AI构建的开源桌面AI Agent,登上GitHub榜单并霸榜一周。它想成桌面级个人AI操作系统入口,但使用体验与愿景有差距,工程架构有亮点,也存在安全风险,其产品哲学有价值但执行粗糙。
硅谷一线创业者内部研讨:为什么只有 5%的 AI Agent 落地成功,他们做对了什么?
来自硅谷一线AI创业者数据显示,95%的AI Agent在生产环境部署失败,原因在于围绕模型搭建的脚手架不完善。文章基于研讨会内容,探讨AI Agent构建关键,如上下文工程、安全控制、记忆功能等,并指出待解决问题和未来方向。
Meta发最强模型打响价格战,小扎对谷歌贴脸开大!北大校友立大功
九月刚过3天就有五个前沿模型发布,Meta发布Muse Spark 1.3踢馆谷歌Gemini 3.8 Flash。它跑分提升大、成本低,性价比高,但也遭质疑,大模型下半场或比拼系统架构和智能体工程能力。
从0到1搭建生产级Agentic AI系统:踩坑心得
作者拆解GitHub上生产级Agentic AI系统项目,指出生产级AI系统要把‘稳定性’‘容错性’‘可运维性’融入代码。介绍了项目在环境配置、LLM调用容错、日志监控等方面的设计,还给出工程化落地避坑指南。
“人人都是程序员”的梦该醒了!AI 编程“大逃杀”:Cursor 或成创业公司唯一“幸存者”,“60 分开发者”撑起最后防线
本文是《2025 年度盘点与趋势洞察》系列之一,探讨 AI 编程工具发展。“氛围编程”热潮退去,产品流量下滑,其营销贩卖财富想象。行业形成两条路径,专业开发者更认可“人主导的严肃工程协同”,创业公司中 Cursor 或有机会。
帮我编假论文?Nature曝arXiv创始人钓鱼实验:13个顶尖AI全沦陷
《Nature》杂志针对13款主流大模型的压力测试,揭示其面对学术造假请求时的表现。arXiv创始人等构建AFIM基准测试,结果显示模型面对持久请求时易妥协,大模型安全护栏脆弱,还可能导致科研垃圾泛滥。
GPT-5.2全力出击!碾压44类专业工作,实测编程同价位无对手、深度推理封神,但速度太拉胯了
GPT-5.2登场,有即时版、思考版与专业版。它在多方面大幅升级,能碾压44类专业工作。经济性强,编程能力佳但速度慢,还自评‘最优科研模型’,幻觉现象减少。今日起推送,优先面向付费用户。
Anthropic:我们如何构建多智能体研究系统
Anthropic分享构建多智能体研究系统的经验,该系统用多个Claude智能体探索复杂主题。介绍了多智能体系统优势、架构、提示工程、评估方法,也提及生产环境的挑战,此系统处理开放式研究任务价值大。
单机H200最快DeepSeek V3和R1推理系统优化秘籍
作者从开源技术分享角度,盘点SGLang对单机规模推理的大量工程优化技巧,涉及FP8 Block GEMM演进、FusedMoE模块优化、Attention Backend优化等,助于提升DeepSeek V3/R1在单机H200上的推理性能。
清华等发布UltraRAG 2.0,仅用50行代码解锁RAG高性能开发
大语言模型存在“知识截止”问题,RAG技术应运而生,成为大模型落地主流方案。但随着需求提升,其工程实现变复杂。清华等推出UltraRAG 2.0,仅50行代码实现同等功能,降低开发门槛,性能提升,还能落地多种场景。