「业务场景」共找到 2373 篇相关文章
Sam Altman:我承认我之前错了,AI 超级系统才是 OpenAI 真正想要的
OpenAI 动作不断,创始人 Sam Altman 在访谈中表示,其目标是构建 AI 超级系统,非「超级 App」。还谈及业务思考,如产品战略、Agent 发展、基建合作,以及 Sora 盈利、版权等问题。
谷歌开源非结构化数据抽取工具
谷歌开源 Python 库 LangExtract,用 LLM 从非结构化文本文档提取结构化信息。它定位精确、输出可靠,针对长文档优化,有交互式可视化,支持多模型,适应多领域,还给出快速开始示例。
Mini-Omni-Reasoner:实时推理,定义下一代端到端对话模型
现有端到端对话模型推理能力未解锁,因深度思考带来延迟。为此提出 Mini - Omni - Reasoner,采用边思考边表达范式,突破‘要么快,要么准’困境,还设计了数据合成管线和五阶段训练方法,实验证明其性能提升明显。
AI在实时视频里秒“剪”出你想要的部分!输入文字/图/视频片段,它都能秒懂|ICCV2025
最新混合模态在线视频定位技术OVG - HQ开挂了!它能根据文字、图、视频片段等线索,在实时视频流中精准裁剪出关心的事件,已收录于ICCV2025,破局以往技术“离线”“词穷”缺陷。
腾讯混元开源AI绘画新框架:24维度对齐人类意图,让AI读懂复杂指令
腾讯混元团队开源PromptEnhancer框架,通过“思维链提示重写”提升AI绘画文本 - 图像对齐精度,复杂场景准确率提升17%以上。还开源高质量基准测试数据集,为研究提供支撑。
GUI 精准定位新 SoTA:LASER 让模型从“看全图”走向“锁重点”
多模态大模型在高分辨率、元素密集的 GUI 场景易误判。苏州大学 OpenNLG 团队提出 LASER 方法,让模型学会主动推理,通过关键区域聚焦等提升定位精度,在基准测试中表现出色。
Vibe Working:AI Coding 泛化的终局想象 |AGIX PM Notes
文章围绕AI领域展开,探讨“Vibe Working”在AI编码及更广泛场景的应用,介绍工作流管理产品;还提及全球市场动态、多起AI相关商业合作与交易,以及ETF分红知识。
刚刚!谷歌推出Nano Banana官方终极指南:六条保姆级权威提示教程,拿走不谢
谷歌推出Nano Banana(即Gemini 2.5 Flash Image图像模型)官方使用指南,含六条提示词模板及示例,介绍文生图等核心功能,还教你编写有效提示词发挥其潜力。
我这半年看过最好的 Vibe Coding 技巧
OpenAI 创始成员 Andrej Karpathy 在 X 阐述 Vibe Coding 实践,提出建立三层结构让不同工具各司其职完成开发。介绍不同场景适用工具,还谈及‘后代码稀缺时代’焦虑,给开发者带来启发。
BRIGHT榜单SOTA!人大&百度ReasonRank:用推理增强的段落重排序器
传统listwise在复杂查询表现差,近期工作泛化性不佳。人大与百度等提出ReasonRank,通过全自动合成13K推理数据及两阶段训练,在BRIGHT等榜单表现优异,且ReasonRank-7B比Rank1-7B快2.5倍。