「长文档处理」共找到 1723 篇相关文章
The Batch: 893 | 从预测到执行
2026 年 AI 研究应认识到能预测的模型不等同于能行动的系统。过去十年在被动预测和生成建模成就非凡,但现实任务需系统执行一系列动作。转向长周期任务和目标导向 AI 系统有两大好处。
B站下场自研AI配音!纯正美音版甄嬛传流出,再不用看小红书学英语了(Doge)
B站发布TTS模型IndexTTS2,亮点是实现时长控制时再现符合Prompt的情感特征,支持两种生成方式,经测试多项指标达SOTA。它由三核心模块组成,还可能是代号H的AI创作工具一环。
Karpathy戳破强化学习神话,首提AI复盘式进化!暴力试错将死
AI大神Karpathy发文指出强化学习(RL)有局限,效率随任务时长下降,与人类学习机制差异大。他提出复盘式进化Scaling范式,虽有很多细节待完善,但认为还有更多S型增长曲线待发现。
LeRobot v0.5.0 正式发布
LeRobot v0.5.0正式发布,是规模最大的一次发布。在硬件上支持更多机器人,策略模型新增6种,数据集处理优化,还推出EnvHub,代码库也全面升级,此外社区与生态建设也有进展。
“开源版贾维斯”一夜席卷硅谷!Mac mini因它卖爆
开源AI助理Clawdbot爆火,GitHub获超两万星。它能调用多模型,被称“开源贾维斯”。为部署它,网友疯抢Mac mini。其作者是退休亿万富翁Peter Steinberger,网友用它处理各类事务,还有挣钱挑战。
两个Ilya的宿命轮回:老黄10亿美金开启赛博修仙!
OpenAI花1亿美金买Torch做「数据转接头」,想让ChatGPT成全科医生;Claude用超长文本窗口处理医学文献和数据。而NVIDIA投10亿与药企建实验室,用BioNeMo重写生命,开启药物生成新纪元。
并行扩散架构突破极限,实现5分钟AI视频生成,「叫板」OpenAI与谷歌?
近日,CraftStory 推出 Model 2.0 视频生成系统,凭借并行扩散架构破解视频时长难题,可生成长达五分钟视频。其由 OpenCV 创建者 Victor Erukhimov 创立,此次突破或为企业带来商业价值,还计划开发新模型。
开源共建重塑推理 Infra:从架构创新到生态协同,Mooncake的破局之路
大模型推理落地面临成本、吞吐、长上下文“三角困境”。开源项目Mooncake以“计算存储解耦”为核心,通过PD分离等技术提供底层支撑。直播邀请专家从多视角拆解其技术逻辑、开源价值与企业实践。
Adaptive Reasoning Model:Qwen3混合思考->字节AdaCoT->清华AdaThinking
文章介绍三种处理混合思考模式的方法,阿里 Qwen3 通过 SFT 让模型具备思考能力,但需人为控制;字节 AdaCoT 和清华 AdaThinking 让模型自主决定是否思考,分别用多目标优化和受限优化目标训练。
免费AI办公套件真香,节省一大笔会员费
Genspark团队开源AI办公套件GenOffice,全平台免费无广告。它界面类似微软Office,零成本上手,AI能直接编辑文档。虽处Alpha阶段,但可切换多种模型,还给出了配置第三方模型的方法。