「工程任务」共找到 2583 篇相关文章
GPT-Image-2正式发布!设计师可以告别「古法设计」了
OpenAI正式发布ChatGPT Images 2.0(GPT - Image - 2),它是首个具“思考”能力的图像模型,处理复杂任务能力强,实测在商品广告、论文海报等场景表现出色,已全量上线,在大模型竞技中领先。
ACL 2026|清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成!
现有文生音频技术在精细化控制方面有挑战,清华团队提出ControlAudio方法。它通过数据构造、渐进式训练和引导采样,在统一框架下实现时间与语音内容联合建模,在多项任务上表现优于现有方法。
YC掌门人60天写了60万行代码,一个人干20人的活,他把方法论全开源了
Y Combinator总裁Garry Tan 60天写超60万行代码,将方法论整合成开源工具gstack。它把Claude Code变成虚拟工程团队,含15个角色和6个增强工具,可并行运行多个Sprint,还具备多种实用能力。
三维空间太难懂?RoboTracer让机器人理解复杂空间指令,推理3D空间轨迹,开放世界也能精确行动
家庭环境复杂,让机器人理解空间指令难,现有VLM多聚焦2D推理。北航、北大等联合推出多模态大模型RoboTracer,能精准生成3D轨迹,在多项评测中领先,还能直接集成到机器人,完成复杂任务。
DeepSeek开源的不仅仅是个新OCR模型。。。
DeepSeek开源3B参数的新OCR模型,重新思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。
刚刚,DeepSeek论文登上Nature,更多细节披露!
9月17日,梁文锋担任通讯作者的DeepSeek - R1推理模型研究论文登《Nature》封面,它是全球首个经同行评审的主流LLM。不靠人工标注,靠强化学习激发推理能力,学会‘自我反思’,在多任务上优于传统模型。
真可用!美团数字人模型开源,MV、电商等统统拿下
美团开源数字人视频生成框架 LongCat - Video - Avatar 1.5 版本,换音频编码器、加速推理,支持多任务与多场景。经770人评测,它在多维度领先对手,各方面表现均衡,效率与质量兼得。
企业级 AI Agent规模化落地的避坑指南,就藏在这四大趋势里
2025 年被视为企业级 Al Agent 落地拐点,“价值导向型”采购兴起,RaaS 正压过传统 SaaS。文章介绍 MCP、GraphRAG、AgentDevOps、RaaS 四大趋势,给出工程化解法,还展示金融、招聘等场景案例及落地自检清单。
知识增强LLM与搜索引擎用户的感知信息价值差异比较研究
研究选取文心一言与百度搜索引擎,探究不同任务复杂性、信息获取场景下,用户使用两种工具后的感知信息价值差异。发现两者在部分指标有显著差异,还给出两类工具优化建议。
MiniMax Agent 再进化!正式走向商业级全栈开发
MiniMax Agent 升级成‘全栈开发师’,建立完整交付标准,构建技术生态。它能完成多任务,配置顺滑,可处理前端问题。还在 MCP 生态、支付集成等方面革新,从工具迈向数字化商业引擎。