「多模态数字人」共找到 2206 篇相关文章
用LoRA微调VLM做乳腺癌病理分类,实战对比CNN
哈萨克斯坦团队论文对比CNN和用LoRA微调的VLM在乳腺癌病理分类上的表现。指出VLM微调后接近CNN水平,但CNN仍是王者。还介绍LoRA原理、实验设计、结果,给出实战代码及对从业者和研究者的启示。
ICML 2026 | 只用少量Thinking Tokens,大模型依然能深度思考
近年来,CoT 推理成为提升大模型复杂问题求解能力的重要路径,但带来效率问题。浙江大学等团队提出 Heima 框架,将冗长 CoT 压缩为少量 thinking tokens,在减少 token 数的同时保留推理能力,已被 ICML 2026 接收。
GPT-5.6曝光了!OpenAI砸钱宣战:换掉Claude Code
GPT-5.5发布三周,GPT-5.6曝光且进入开发全速阶段,预计下月亮相。OpenAI本周四将上线「ultrafast模式」,速度提升2 - 3倍。Codex与Claude Code全面开战,OpenAI砸钱吸引开发者,AI自我加速与商业化形成正反馈。
Canva可画联合创始人独家专访:2.65亿用户的Canva,用自研模型,解决了设计的审美问题
Canva月活2.65亿,在a16z排名第三。4月16日开启Canva AI 2.0内测。联合创始人Cameron Adams称,自研模型结合14年数据是护城河,Magic Layers功能验证其价值。Canva要成用户进入AI入口,还会在中国持续投入。
大厂都在卷千亿大模型,这家深圳企业却专啃“最后一公里”
在CITE 2026上,佑泰创始人张希立分享企业战略。佑泰与大厂不同,走差异化路径,聚焦算力落地“毛细血管”,产品覆盖多应用方向,还将转型提供完整算力服务,积极布局信创,面对成本压力坚守契约。
AI短剧成了!LibTV-seedance2支持“真人模式”:一手实测,视频闪电直出,效果炸裂
LibTV首发支持Seedance 2.0真人生成视频功能,操作简单严谨。真人出镜可用于虚拟主播、数字分身、角色替换等场景。该工具工作流高效,接入主流模型,价格有优惠。
NeurIPS事件发酵,多位学者拒绝出任AC
NeurIPS因美国法规不接收华为等受制裁实体投稿,引发学术界震荡,许多学者不满。中国计算机学会发声反对,呼吁学者拒绝服务与投稿,已有学者拒任领域主席,还引发对其他会议的担忧。
ADHD,反而成了 AI 时代的版本答案?!
文章探讨ADHD在AI时代的意义。ADHD大脑多巴胺调节回路有差异,过去被视为问题的特质如今成优势,如发散创造力、短时聚焦和混乱适应力。AI为ADHD带来新体验,让其更适合开荒。还分享在AI时代做ADHD的经验。
【深度长文】从“会聊天”到“能干活”:OpenClaw架构深度拆解与价值挖掘
文章深度拆解 OpenClaw 架构,指出传统 SaaS 走向末路,OpenAI Operator 有局限。OpenClaw 以本地原生机制崛起,具备诸多优势,还介绍了其安全方案及五大高价值商业场景,鼓励关注学习。
告别AI「鬼画符」!一行指令「复活」王羲之、苏轼,带连笔、懂排版,项目已开源丨ICLR'26
UniCalli由香港科技大学(广州)等团队推出,是全新统一扩散框架,能精准生成书法排版和连笔,将书法生成和古籍识别统一,工作被ICLR2026接收,代码、数据集开源,还有在线Demo。