「系统级工程能力」共找到 4978 篇相关文章
出自小米的模块化图像编辑改造:让 AI 学会「搭积木」
小米研究团队发布 Lego-Edit 图片编辑框架,将复杂编辑任务拆成工具集和调度系统,工具集模型各司其职,调度系统指挥操作。采用渐进式训练,性能优、扩展性好,体现协同智能优势。
大模型Agent的核心还是prompt? 目前有什么挑战?
文章指出大模型Agent核心并非Prompt,而是工程化架构设计、工作流编排与数据闭环。介绍Flow Engineering等概念及工具,分析规划、记忆、工具使用要点,还谈及开发面临的延迟、稳定等挑战,并给出应对建议。
当AI进入物理世界:西门子科技大会要回答一个关键问题 | 甲子光年
2026年3月23 - 24日西门子将在北京举办科技大会,将系统呈现AI进入现实工业系统后的技术结构,探讨AI融入生产体系问题。大会还将举行多场活动,众多企业领袖将参与对谈。
Nano Banana Pro或将引爆新安全危机
基于Gemini 3的图像生成模型Nano Banana Pro昨日上线,支持2K/4K分辨率生成,排版和文字控制能力提升。它展现出复杂推理能力,能理解反光、推理指纹,但这或带来隐私危机。
会“思考”的目标检测模型来了!IDEA提出Rex-Thinker:基于思维链的指代物体检测模型,准确率+可解释性双突破
现有目标检测方法有决策不透明和拒识能力不足问题。IDEA提出Rex - Thinker,引入“逻辑推理链”,构建可解释推理框架,经两阶段训练,在测评中准确率提升,可解释性强,有良好泛化能力。
PDF/DOCX/HTML/扫描文档接卸不再愁!D自动解析文档并统一格式的开源库edoc
Dedoc是开放通用系统,能将文档转换为统一格式,提取逻辑结构和内容。用Python实现,支持多种格式,有可扩展性等优势,还能处理扫描文档,可用于多个系统,介绍了安装方法。
用AI把一段视频变成可视化网页,Google的新模型又卷飞了。
Google将Gemini 2.5 Pro更新为05 - 06版,此版代码能力在WebDev Arena盲测竞技场登顶,还提升视频理解能力,可将视频变成可视化网页,虽产品有不足,但模型进步值得肯定。
DeepSeek Harness和V4 Pro正式版同时重磅上线,一手实测:DSH更像是AI操作系统
DeepSeek V4 Pro正式版0813上线,升级Agent能力,网页、API、app皆可用。DeepSeek Harness亮相并开源,基于“一切皆插件”理念。V4 Pro跑分部分能力突出但价格将涨,其实际表现待更多测试。
数百个虚拟人在线逃生!天大等发布:首个实时在线多智能体模拟方法
天津大学联合清华和卡迪夫大学推出RESCUE系统,把「大脑感知 - 决策 - 行动」循环搬进电脑,让数百虚拟人在线逃生。该系统能实时呈现地形等信息,还能标记身体碰撞力,可用于公共安全场景演练。
ICLR 2026 oral | AI代码真能进生产环境?SwingArena:从「写对代码Commit」到「通过CI审查」
过去一年大模型写代码能力提升,人们思考其能否参与软件工程核心流程。现有评测基准有缺失,SwingArena填补空白,将博弈引入评测,设计检索增强流水线,其开源后或成评估AI编程能力新工具。