网界
网络资讯 网界财经 科技人物 数据洞察 行业动态 智能出行 智能手机 数码极客 商业资讯

DeepSeek-V4.1-Flash登陆千问AI平台 轻量架构低资源消耗助力开发者高效部署

2026-09-14来源:互联网编辑:瑞雪

DeepSeek-V4.1-Flash模型近日正式登陆千问AI平台,同步开放API服务与Token订阅计划。开发者既可通过标准化API将其集成至业务系统,也支持在Qoder、千问APP及Codex等工具中直接调用Token资源,覆盖代码生成、文档处理、视觉理解及智能体任务等场景。该模型采用混合专家(MoE)架构,总参数规模达5520亿,通过Causal-Encoder-Decoder非对称设计实现输入激活80亿、输出激活160亿参数的轻量化运行,原生支持文本与图像多模态理解,最长上下文窗口扩展至100万token,平台单次最大输出约393K。

平台公告显示,V4.1-Flash在Agent能力与代码生成基准测试中较前代产品显著提升,其核心优势在于通过更低的激活参数实现高吞吐量与低延迟响应。技术团队采用新一代缓存压缩技术,将KV Cache对高带宽内存(HBM)的需求降至前代的四分之一,固态硬盘(SSD)存储需求压缩至八分之一,特别优化了长上下文处理与多轮工具调用的资源消耗效率。

成本方案成为本次发布焦点。千问平台推出分时段定价策略:闲时(非高峰时段)输入成本为1元/百万token,输出4元/百万token;忙时(高峰时段)输入2元/百万token,输出8元/百万token。系统设置每分钟15000次请求(RPM)与每分钟100万token处理量(TPM)的速率限制,支持前缀补全、函数调用、缓存管理、结构化输出、批量任务处理及联网搜索等六大功能模块。

部署层面,阿里云百炼平台与vLLM开源社区完成深度适配,提供中国站与国际站双通道调用服务,覆盖北京、新加坡及美国、德国、日本、中国香港等全球主要区域。技术文档指出,该模型支持多轮对话记忆、动态函数调用、实时联网检索及上下文缓存复用,单次最大token处理量约393216,特别适合企业将长文档解析、智能客服知识库、代码库问答及多模态单据审核等业务整合至统一接口。

行业分析认为,V4.1-Flash通过"大参数储备、小激活运行、强缓存管理"的技术组合,有效降低了长上下文智能体开发的试错成本。对于中小型研发团队,闲时低价策略结合Token订阅模式,使其能够以更灵活的成本结构开展批量推理任务与产品原型验证,这种技术普惠性或将推动AI应用生态的多元化发展。