「复杂任务处理」共找到 3124 篇相关文章
大神Karpathy炮轰复杂UI应用没有未来,Adobe首当其冲,网友:不提供文本交互,就是在阻挡AI浪潮
大神Karpathy预言只有复杂UI界面、不提供文本交互的应用将被淘汰,还点名Adobe、CAD。他言论引发讨论,支持者强调后端接口,反对者认为专业软件有其价值。此外,他还批判大模型编程‘重生成轻判别’。
北大 & 作业帮团队提出 Text-to-SQL 新框架 Interactive-T2S,攻克宽表处理与低资源对齐难题
北大与作业帮联合研发的论文提出 Interactive-T2S 框架,将 LLM 塑造成智能代理,通过多轮交互解决传统 Text-to-SQL 方法在宽表处理、低资源对齐等方面的难题,已入选国际顶会 CIKM2025。
解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换
视觉-语言-动作(VLA)模型是端到端自动驾驶主流技术,但自回归解码架构有瓶颈。复旦大学与引望智能联合提出WAM-Diff2,实现自回归VLA向离散扩散模型迁移,解码加速15.1倍,多任务性能不降。
浙大&港理工等提出InfiGUI-R1:利用强化学习,让GUI智能体学会规划任务、反思错误
多模态大模型驱动的GUI智能体有潜力,但现有智能体面对复杂任务力不从心。浙大等机构提出InfiGUI-R1及Actor2Reasoner框架,通过两阶段训练提升智能体能力,InfiGUI-R1-3B在多基准测试中性能卓越,为GUI自动化工具开辟新道路。
AST | 西交大牛笑天、陈刚等:基于多尺度网格融合技术的复杂三维构型流场时空智能推理方法
文章针对复杂三维外形的强非线性非定常流场推理难题,提出MSGF数据预处理方法与DTECAU - 3D模型联合框架。MSGF解决数据提取难题,DTECAU - 3D解决传统U - net问题,经测试验证该框架效果良好。
美团开源LongCat-Image,6B参数挑战80B效果,中英双语理解、图像逼真度及复杂指令编辑新突破
美团开源6B参数图像模型LongCat-Image,在双语文本理解、图像逼真度及复杂指令编辑任务中表现出色。它以轻量化设计超越大模型,还解决中文文本渲染难题,有精确图像编辑能力,且提供全链路开源方案。
真6,上线几天,轻松斩获10k,首款开源通用AI智能体Suna:一句话自动处理Excel/爬数据/写报告,程序员私人助理诞生!
Suna是Kortix推出的全球首个开源通用型AI Agent,核心突破是“执行力”,能像人类员工操作数字工具。它开源透明,是全能数字员工,已落地多场景,有五大核心功能。还给出部署方法和同类对比。
刚刚,GPT-5.1发布,OpenAI开始拼情商
深夜,OpenAI上线GPT - 5.1 Instant和GPT - 5.1 Thinking模型。前者更温暖智能、指令执行强,后者处理任务更高效易理解,语气温暖。模型将逐步推出,还发布系统卡附录。
Karpathy 教它的 nanochat 数单词里有几个“r”
Andrej Karpathy 教超小型语言模型 nanochat d32 数单词里字母 r 的数量,创建 SpellingBee 合成任务微调模型,虽像填鸭式教学但有效,不过小模型上下文处理能力有限。
Andrej Karpathy 分享ChatGPT模型选择指南
前OpenAI创始成员Andrej Karpathy发文分享ChatGPT模型使用指南,点出关键事实,如o3适合重要任务。社区热烈讨论,专业用户分享策略,还对o4 - mini等模型表现给出反馈。