「长链执行」共找到 1427 篇相关文章
Mamba一作预告新架构!长文论述Transformer≠最终解法
Mamba一作将演讲整合成科普长文,探讨SSMs和Transformer模型权衡之术。认为Attention非万能,Transformer是阶段性最优。几天后将发布新架构,能与Transformers兼容,还回顾了两模型特点及结合优势。
波士顿初创靠铝厂废液提镓,意图改变美国半导体供应链
美国麻省理工博士皮特·戈达特创立 Found Industries 公司,研发出把废铝变零碳燃料和从铝厂废液提镓两项技术。公司获美政府 540 万美元支持,计划 2027 年底量产镓等金属,还在推进铝燃料业务。
功能全面的Agent!吸取了open-manus,langmanus众家之长
Cooragent是在langmanus基础上重大改进的Agent框架。文章介绍其本地部署、CLI工具使用、添加MCP服务等实战操作,还提及深度兼容Langchain工具链、支持MCP等特点,有两种工作模式。
X-Actor 惊艳登场!长时唇动+情感同步人像动画生成
字节提出 X - Actor,一个音频驱动自回归扩散框架,能通过一张静态参考图像和一段音频生成逼真、富有情感表达的人像动画视频。其核心是两阶段解耦生成流程,实现长时间唇形同步与情感音频一致性。
OpenAI和Anthropic费尽心机加密的思维链,竟然能被轻松提取?
围绕大模型蒸馏争议已久,此前外部团队难获闭源模型完整推理。8 月 10 日研究者公开方法,可让弱模型读取旗舰模型密文并输出推理,还发现公开智能体轨迹存在隐私泄露问题,不过未为蒸馏指控提供决定性证据。
开源安全工具 Trivy 遭供应链攻击,引发行业紧急响应
开源漏洞扫描工具 Trivy 遭供应链攻击,恶意版本 v0.69.4 含外传敏感数据代码,通过正常渠道传播。攻击者利用攻破的凭证操控发布流程,影响或扩大,维护团队已采取措施,引发行业对开源工具信任边界的讨论。
如何判断 AI 将优先自动化哪些任务?
思考AI优先自动化哪些任务,可从‘描述 - 执行鸿沟’视角出发。‘描述 - 执行鸿沟’大的任务是自动化沃土,反之自动化价值有限且创建训练数据难,它与‘判别器 - 生成器鸿沟’相似又不同。
静态稀疏已死:Flux Attention 开启长文本 LLM 自适应推理新时代
文章指出长上下文LLM高效推理面临性能与效率难题,先介绍Elastic Attention打破静态稀疏桎梏,后重点阐述全新的Flux Attention,它将动态稀疏注意力范式升级为层级别路由,解决了算法与硬件的矛盾,在多方面实现突破。
DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案
DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。
低Token高精度!字节复旦推出自适应推理框架CAR
字节与复旦大学研究人员提出自适应推理框架CAR,能根据模型困惑度动态选短答或长推,在多基准测试中平衡了准确性与效率,打破长文本推理必然性能更好的认知。