长文本理解」共找到 1687 篇相关文章

开源动态8

看完Kimi K2.5技术报告,它的视觉Agentic真给我惊到了

Moonshot AI发布Kimi K2.5技术报告,该模型将文本和视觉打通,有并行执行的智能体集群系统。它采用Joint Training,提出“Zero-Vision SFT”,用MoonViT - 3D处理图像和视频,开源后受欢迎,展示通用智能体可能。

PaperAgent
新闻资讯7

你以为在点「红绿灯」验证身份,其实是在给AI免费打工

验证码发展多年,从最初文本形式到如今图像形式。用户点选验证码时,实际在为AI免费提供训练数据,如谷歌让全球网民免费转录资料、为自动驾驶AI打工。如今验证码攻防战激烈,未来或利用AI弱点创新。

机器之心
产品应用8

上帝视角!DeepMind提前5天锁定Melissa,强度预报不再靠天

飓风Melissa来临前,DeepMind算法提前5天预言其强度变化。该模型用两类数据训练,能生成多种未来场景,在路径和强度预测上优于传统模型,已被NHC投入实战,但AI不能理解灾难,人类仍需做决策。

新智元
新闻资讯8

对话智源王仲远:机器人的大小脑可能会“合体”,但不是今天

今年智源大会上,智源研究院推出“悟界”系列大模型,如Emu3、Brainμ、RoboOS2.0、RoboBrain2.0和OpenComplex2。智源研究院王仲远称大模型技术未到尽头,介绍了模型特点及发展趋势,如机器人大小脑融合需时间。

AI前线
产品应用7

视频进入可编辑时代:藏师傅教你视频版 Banana 可灵 O1

可灵发布大一统视频、图像生成和编辑工具 O1,支持在一个界面完成视频图片编辑生成。此次更新统一多模态视频大模型,支持多模态输入,有诸多新特性,还支持自由选择视频生成时和风格转换等。

歸藏的AI工具箱
算法论文8

EMNLP2025 | SFT与RL的结合,vivo AI Lab提出新的后训练方法

vivo AI Lab 算法团队提出新的大模型后训练框架 GTA,综合 SFT 和 RL 优点,解决文本分类场景中 RL 收敛慢问题。论文已被 EMNLP 2025 录用,介绍了 GTA 框架设计思路、实验结果等,未来还将探索更多场景和大模型。

机器之心
新闻资讯7

大模型下半场,阶跃凭什么领跑多模态之战

国内大模型竞争分资源派、技术派、国家队三阵营,多模态成竞争分水岭。阶跃星辰成立两年发22款自研基座模型,16款为多模态。其坚持理解生成一体化路线,在多模态领域有优势,还布局多应用场景。

AI科技评论
新闻资讯7

Axiom Math 对谈 SGLang:模型的下一步是可验证,结果层才是真正的护城河

在AGI Playground 2026圆桌论坛,Axiom Math联合创始人等探讨AI核心问题。提到AI进入生产环境,可验证或成瓶颈,还从任务智能体、推理基建等多方面深入交流,如模型验证、基建优化等。

Founder Park
新闻资讯8

他在 10 天内拼出 ChatGPT,如今影响 7 亿人:ChatGPT 负责人的第一次讲述

OpenAI产品负责人Nick Turley首次分享ChatGPT幕后故事。ChatGPT从黑客马拉松项目起步,10天内发布,如今周活超7亿。他还介绍了GPT - 5特性,以及ChatGPT期愿景、发展迭代、团队组建等情况。

AI前线
产品应用7

死磕即梦48小时,我发现了AI公众号封面的懒人密码

作者与即梦Agent死磕48小时,分享AI公众号封面制作经验。介绍垫图法、两个提示词模板,测试提示词反推、语义理解等功能,指出不足,认为即梦像AI作图界拼多多,瑕不掩瑜。

AI产品自由