「理解与生成统一」共找到 3126 篇相关文章
阿里Qwen3一大波更新:代码生成、视频、图片、语音全都有
阿里Qwen3迎来一大波更新,涵盖多个模型。如Qwen3-Max在代码与智能体表现卓越;Qwen3-VL是强大视觉语言模型;Qwen3-Omni是全模态模型;还有图像编辑、同传、安全防护等模型及旅行规划师等应用。
为什么我坚决投入GEO(生成式引擎优化)?
AI改变流量分配规则,站长竞争焦点从‘排名位置’变为‘被引用率’,GEO应运而生。作者总结了GEO打法,如优化全站、关键页面,做结构化数据增强,还应用于自身产品。
深度长文AI一键生成:实测字节扣子空间新功能
文章实测字节扣子空间新功能,它自比「深度长文写作加速器」。从多方面考验,发现其一键总结方便,写论文、分析社会议题、创作抒情内容等各有表现,适合内容创作,但故事创作表现欠佳。
11.8k Star 爆火!Firecrawl开源王炸,秒级生成React应用!
知名网页抓取工具Firecrawl团队推出开源项目Open Lovable,几天内获11.8k Star。它是AI网页克隆工具,能秒级将网站克隆为React应用,功能丰富,适合多类人群,还介绍了上手步骤和应用场景。
隐私堡垒!Presenton开源革命:本地AI生成PPT,敏感数据永不触网!
本周GitHub新开源项目Presenton可离线制作PPT,支持主流AI模型,本地运行保护数据隐私,有灵活自定义模板和API集成功能,还具备多模型支持、主题定制等特性。
世界首个「实时、无限」扩散视频生成模型,Karpathy投资站台
Decart发布世界首个「实时、无限」扩散视频模型MirageLSD,输入视频流能快速转化画面,前特斯拉AI总监Karpathy投资。它在时长和延迟上有突破,也有需改进之处。
一句话生成任务专属LoRA!Transformer作者创业公司颠覆LLM微调
Transformer作者之一创立的SakanaAI推出Text-to-LoRA(T2L),简化模型适配流程,省却繁琐微调。T2L参数压缩率达80%仅降1.2%准确率,零样本场景平均准确率78.3%超现有SOTA方法,开启“一句话定制模型”时代。
SeePhys Pro:重新审视多模态物理推理中的视觉理解与训练收益
来自中山大学等的研究者提出SeePhys Pro,是面向多模态物理推理的细粒度评测与训练诊断框架。发布了benchmark、训练集等,测评显示当前模型在信息模态转变时不稳定,为模型评测和训练研究提供基础。
AI 行业悄悄统一了一件事:Agent Skills 开放标准全解析
Agent Skills 是一套开放标准格式,超 30 家主流 AI 开发工具已采纳。它结构简洁,有精妙的三层加载机制,解决了 AI Agent 上下文窗口问题。与 MCP 解决不同层面问题,生态正快速成型。
测完阿里的Accio Work,我理解了「一人跨国公司」为什么可能
作者体验阿里Accio Work后认为,它作为面向全球中小企业和创业者的企业级Agent,像出厂就懂做生意的团队,能让电商小白从零搭Shopify店,通用Agent难以做到,体现数据和场景壁垒。