「场景化落地」共找到 3321 篇相关文章
GUI 精准定位新 SoTA:LASER 让模型从“看全图”走向“锁重点”
多模态大模型在高分辨率、元素密集的 GUI 场景易误判。苏州大学 OpenNLG 团队提出 LASER 方法,让模型学会主动推理,通过关键区域聚焦等提升定位精度,在基准测试中表现出色。
人类秒懂,AI崩溃:一个简单测试,就让GPT-5、Gemini等顶级模型集体“翻车”
来自多机构研究团队发现,OpenAI的GPT-5等顶级AI模型,面对‘看得见但读不懂’文字时表现极差。VYU团队实验显示,人类能轻松读懂的切分拼接文字,AI却全军覆没,原因是其靠模式匹配,不懂文字结构。
我这半年看过最好的 Vibe Coding 技巧
OpenAI 创始成员 Andrej Karpathy 在 X 阐述 Vibe Coding 实践,提出建立三层结构让不同工具各司其职完成开发。介绍不同场景适用工具,还谈及‘后代码稀缺时代’焦虑,给开发者带来启发。
BRIGHT榜单SOTA!人大&百度ReasonRank:用推理增强的段落重排序器
传统listwise在复杂查询表现差,近期工作泛化性不佳。人大与百度等提出ReasonRank,通过全自动合成13K推理数据及两阶段训练,在BRIGHT等榜单表现优异,且ReasonRank-7B比Rank1-7B快2.5倍。
腾讯Youtu-agent 不会代码,也能搞定数据分析+深度研究+HTML报告
腾讯开源的Agent框架Youtu - agent灵活高性能,可用于数据分析等多任务。基于openai - agents构建,适配多种模型API等。突出优势是能自动化生成智能体及其配置,采用YAML配置方案,有内置‘元智能体’,还完全异步。
首个接入GPT-5的视频Agent!一句话生成商业级广告大片,分镜配音字幕等全包了
AI视频生成进入Agent时代,Video Ocean是首个接入GPT - 5的视频Agent,输入提示词就能自动完成分镜、画面等生成爆款视频。它有自动化创作生态系统,操作简单,新手也能上手。
Pinterest 在迁移到 Kubernetes 的过程中发现了罕见的搜索失败
Pinterest 工程师披露将搜索基础设施迁移到 Kubernetes 时遇‘百万分之一’故障调试过程。故障由容器化组件与遗留设施过渡时细微不一致触发,该事件凸显云原生迁移挑战及调试价值。
腾讯出手了!彻底入局Agent
腾讯云入局智能体赛道,将大模型知识引擎升级为智能体开发平台。该平台亮点多,如可一键发布到企业微信,具备多工具调用、多Agent协作能力,工作流有全局视野Agent节点,还有Excel检索增强功能,经测试表现出色。
3.8K星爆款!Google「langextract」可视化溯源,信息抽取神器
Google的「langextract」在GitHub获3.8K星,是信息抽取神器。它有精准源定位、可靠结构化输出等特点,支持多种LLM,适用于各领域,文章还给出实战代码示例。
OpenAI 内部访谈流出:新 Agent 强到让我们害怕,已接近“自我进化”的边缘!
红杉资本访谈 OpenAI 打造新款 ChatGPT Agent 的核心成员。介绍 Agent 结合多工具、共享状态,能执行复杂任务。还谈及起源、训练方法、应用场景,以及安全挑战和未来规划等。