「长文本处理」共找到 1803 篇相关文章
Nano banana手办玩法火爆出圈!无需抽卡,效果惊了(°o°)
小某书被AI手办图刷屏,原来是谷歌的nano - banana(Gemini 2.5 Flash Image)模型爆火。文章实测其手办玩法,还介绍多种玩法,团队透露以文本渲染评估、原生多模态等核心技术,谷歌未来想整合模态实现AGI,还将举办黑客松。
韩松等提出FlashMoBA,比MoBA快7.4倍,序列扩到512K也不会溢出
今年2月月之暗面提出MoBA,在处理长上下文有潜力,但业界缺乏对其性能设计原则的理解和高效GPU实现。来自MIT、NVIDIA的研究者提出FlashMoBA,解决了小块MoBA性能挑战,实验显示其在多方面表现优。
「注意力经济」下,AI 生活助手能否解锁生服「新」刚需?
今年不少国内大厂加码AI生活助手赛道。腾讯、阿里、美团、京东、滴滴等各有动作,如腾讯在微信上线「元宝」,阿里在电商业务开发助手。当前AI应用使用时长和留存率不佳,而助手或能过滤信息、缩短决策链路。
香港科技大学、Manycor开源空间大模型,超3000颗星
香港科技大学、Manycore联合开源空间大模型SpatialLM,用于处理3D点云数据。它结合点云特征提取、对齐和语言生成,实现高效转换。研究团队经多种尝试选定基于点的方法及Sonata编码器,还选Qwen2.5 - 0.5B为基础模型。
【一手实测】字节豆包 1.6 + Trae + 火山 MCP + FaaS:AI Agent 开发部署全流程体验!
本文作者实测字节豆包1.6系列模型,用其设计落地页,还借助Trae、火山方舟MCP等实现AI Agent开发部署全流程。测评显示豆包1.6多模态能力强,处理复杂指令效果好,价格实惠,字节AI云原生生态前景佳。
全球唯二、国内首个,阿里万相2.6杀疯!Sora 2瞬间不香了
阿里万相2.6系列模型上线,成为业界功能最丰富的视频模型,是全球唯二、国内首个具备角色扮演功能的模型。其音画一体,能生成15s长视频,指令遵循能力强。还可将提示词转换为多分镜脚本,团队公开了提示词公式。
刚刚,美团推出 136 亿参数视频生成模型
美团推出 136 亿参数视频生成基础模型 LongCat-Video,采用 MIT 开源协议。该模型覆盖文本、图像生成视频及视频续写三类任务,能生成分钟级长视频。效率高,评测数据表现佳,安装和运行简便,引网友惊叹。
4B小模型数学推理首超Claude 4,700步RL训练逼近235B性能 | 港大&字节Seed&复旦
香港大学NLP团队联合字节跳动Seed、复旦大学发布Polaris强化学习训练配方,让4B模型数学推理能力超商业大模型,且Polaris-4B可在消费级显卡部署,相关内容已全部开源。
具身智能开始进入「下半场」:从会干活到干完活
具身智能正处热门,国内今年上半年赛道融资额高涨。但钱与落地有落差,拉格朗日具身技术自研 Agentic OS,采用分层智能架构处理工程问题。还推动工序重构,制定技能矩阵和排期计划,其团队背景多元,赌让机器人干完活路径。
搜狗输入法,居然还在更新??
在腾讯微信输入法上线、各类AI新产品轰炸的当下,搜狗输入法进行20.0 AI大版本升级。它有AI文本翻译、轻声识别等功能,用AI大模型全面重构,还接入腾讯混元、DeepSeek R1大模型,免费提供AI服务。