OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024开源了新模型
根据官方来源,OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024开源了新模型。详细信息请以原始来源为准。
证据来源
查看来源摘录
OpenMOSS OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024 OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024 https://huggingface.co/OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024
查看来源摘录
OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024 · Hugging Face Hugging Face (https://huggingface.co/) Models (https://huggingface.co/models) Datasets (https://huggingface.co/datasets) Spaces (https://huggingface.co/spaces) Buckets new (https://huggingface.co/storage) Docs (https://huggingface.co/docs) Enterprise (https://huggingface.co/enterprise) Pricing (https://huggingface.co/pricing) Website Tasks (https://huggingface.co/tasks) HuggingChat (https://huggingface.co/chat) Collections (https://huggingface.co/collections) Languages (https://huggingface.co/languages) Organizations (https://huggingface.co/organizations) Community Blog (https://huggingface.co/blog) Posts (https://huggingface.co/posts) Daily Papers (https://huggingface.co/papers) Hardware (https://huggingface.co/hardware) Learn (https://huggingface.co/learn) Discord (https://huggingface.co/join/discord) Forum (https://discuss.huggingface.co/) GitHub (https://github.com/huggingface) Solutions Team & Enterprise (https://huggingface.co/enterprise) Hugging Face PRO (https://huggingface.co/pro) Enterprise Support (https://huggingface.co/support) Inference Providers (https://huggingface.co/inference/models) Inference Endpoints (https://huggingface.co/inference-endpoints) Storage Buckets (https://huggingface.co/storage) Log In (https://huggingface.co/login) Sign Up (https://huggingface.co/join) (https://huggingface.co/OpenMOSS-Team) OpenMOSS-Team (https://huggingface.co/OpenMOSS-Team) / Qwen3-8B-base-mla-topk8-rank1024 (https://huggingface.co/OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024) like 0 Follow OpenMOSS 1.18k Safetensors (https://huggingface.co/models?library=safetensors) qwen3 (https://huggingface.co/models?other=qwen3) mla (https://huggingface.co/models?other=mla) mlafication (https://huggingface.co/models?other=mlafication) delta-weights (https://huggingface.co/models?other=delta-weights) License: apache-2.0 Model card (https://huggingface.co/OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024) Files Files and versions xet (https://huggingface.co/OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024/tree/main) Community (https://huggingface.co/OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024/discussions) Copy to bucket new Qwen3-8B-base-mla-topk8-rank1024 (https://huggingface.co/OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024#qwen3-8b-base-mla-topk8-rank1024) Variant (https://huggingface.co/OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024#variant) Loading (https://huggingface.co/OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024#loading) Files (https://huggingface.co/OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024#files) License (https://huggingface.co/OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024#license) (https://huggingface.co/OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024#qwen3-8b-base-mla-topk8-rank1024) Qwen3-8B-base-mla-topk8-rank1024 This repository contains the attention-only incremental weights for an MLAfication conversion of Qwen/Qwen3-8B-Base (https://huggingface.co/Qwen/Qwen3-8B-Base) . It is not a standalone full-model checkpoint. (https://huggingface.co/OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024#variant) Variant Field Value Base model Qwen/Qwen3-8B-Base Base revision 49e3418fbbbca6ecbdf9608b4d22e5a407081db4 MLA latent rank 1024 RoPE dimensions per KV head 8 Training checkpoint step 1200 Delta tensors 216 Delta size 1.57 GiB SHA-256 4fb00adef74293384b0a20e25dc7d70cc0f9c2903410fb875bdb18ee7e412ddb The delta contains only q_proj, k_r_proj, low-rank kv_proj, and QK-Norm parameters. Embeddings, MLP/MoE, output projection, LM head, and other base-model parameters are intentionally omitted. (https://huggingface.co/OpenMOSS-Team/Qwen3-8B-base-mla-topk8-rank1024#loading) Loading Use the MHA2MLA-V2 (https://github.com/JT-Ushio/MHA2MLA-V2) implementation to instantiate the MLAfication architecture from the base model, then load model.safetensors with strict=False: from safetensors.torch import load_file delta = load
来自 星盘大模型百科