「生成式搜索」共找到 2930 篇相关文章
刚刚,DeepMind开源全栈「Deep Research」项目,AI 研究将人人可用
谷歌DeepMind团队开源基于Gemini 2.5的全栈「Deep Research」项目,能让每个人拥有智能研究助手。它可动态搜索、反思结果,以流式传输提供带引用答案,前后端结合,还介绍了特性、原理、技术栈等。
利用大模型检测钓鱼邮件:方法,效果及数据集
随着企业安全防范增强,钓鱼邮件成重要攻击手段,大模型检测方法盛行。日本论文详细披露检测方法和实验数据,含解析解码、简化邮件、生成prompt、调用LLM四步,还介绍数据集及评估了四个模型效果。
颜水成领衔,给AI分段位!超100款多模态模型,无人达到L5
十所顶尖高校联合发布General - Level评估框架和General - Bench基准数据集,用五级分类制明确多模态通才模型能力标准。评估超100款模型,发现多数在L2 - L3,无L5模型,揭示当前模型不足。
Speech-02语音模型登顶国际榜单:完美复刻声音,同事听后难辨真伪
MiniMax的Speech-02语音模型登顶国际榜单,超越OpenAI等海外模型。它引入可学习说话人编码器,有高扩展性,还能结合文本描述生成音色。测试显示其音色丰富、读音准、支持多语种,声音复刻逼真。
Claude两个新模型实测流出!空间推理封神,算力直接榨干了
Claude两款新模型“棉花糖”和“甜瓜”实测流出,在3D强化学习和建筑空间布局上性能强大,还能直接理解并生成复杂3D坐标和空间关系。它们对算力吞噬疯狂,引发对其身份的猜测。
这个开源项目 OpenStory,把 AI 短剧制作变成了一条可复制的工业流水线!
现在制作完整AI短剧流程繁琐,很多团队是小作坊式生产,效率低且难规模化。OpenStory开源项目站在成熟AI服务肩上,将AI短剧制作工业化,能把剧本变成风格统一的视频作品,解决诸多痛点。
让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni
openJiuwen社区发布业界最早工程化落地的多模态Skill范式Skill-Omni,让Agent经验从‘读得懂’升级为‘看得见’。它能将网页和视频视觉知识沉淀为多模态Skill,还介绍了生成及读取方式和适用任务。
机器人看视频学操作!伯克利首次打通互联网视频到灵巧手真机部署链路
UC Berkeley团队提出端到端流程,跑通从网络视频生成真实灵巧手实机执行轨迹链路。解决了单目RGB视频手-物交互重建、带噪声参考轨迹动作重定向及遥操作规模化难题。还给出数据筛选要点。
这家 AI Lab 宣布所有模型无限期免费后,我顺手做了个图片版番茄钟
全球排名前十的 AI Lab,Agnes 宣布旗下核心全模态模型 API 无限期免费开放,包括文本、图片、视频。还新增百万 Token 上下文和 4K 图片生成功能。作者用其做了图片版番茄钟,官方也公开开发进度。
The Batch: 954 | Kimi K2.6 挑战开源权重模型领先者
Moonshot AI升级后的Kimi K2.6是1万亿参数的视觉 - 语言模型,专为代码生成设计,性能与Qwen3.6 Max Preview等相当,略逊顶级闭源模型。其功能多,幻觉率低,模型权重可免费下载。