Nex-N2.5-mini-W4A16-AutoRound (Máxima Precisão)

Quantização de máxima precisão em W4A16 (INT4) do modelo multimodal e agentic nex-agi/Nex-N2.5-mini usando a biblioteca Intel AutoRound.

Visão Geral do Modelo

  • Modelo Base: nex-agi/Nex-N2.5-mini
  • Arquitetura: qwen3_5_moe (Qwen3_5MoeForConditionalGeneration)
  • Parâmetros Totais: 35B (~3B ativos por token)
  • Modalidades: Texto e Imagem (Multimodal Vision-Language)
  • Especialistas: 256 especialistas roteados + 1 especialista compartilhado (shared_expert) por bloco
  • Context Window: 262.144 tokens (262k)

Detalhes Técnicos da Quantização

  • Método: Intel AutoRound (SignRound Algorithm)
  • Precisão: W4A16 (Pesos em INT4 com group-size 128, Ativações em 16-bit / BF16)
  • Simetria: Simétrica (sym=True, otimizada para o kernel Marlin no vLLM e SGLang)
  • Iterações por Bloco (iters): 200 (otimização de erro quadrático mínimo)
  • Tuning Avançado: enable_minmax_tuning=True e enable_norm_bias_tuning=False (preserva RMSNorms e Gated Norms em BF16)
  • Amostras de Calibração: 128 amostras com janela de 2048 tokens (NeelNanda/pile-10k)
  • Formato: auto_gptq (compatível com GPTQ / Marlin kernels)
  • Camadas Preservadas em BF16:
    • shared_expert e shared_expert_gate (ativos em todos os tokens, preservando raciocínio central)
    • mlp.gate (router dos especialistas, preservado para estabilidade do vLLM)
    • mtp (Multi-Token Prediction)
    • lm_head e embeddings
    • Componentes de visão (visual encoder)

Como Utilizar

1. Com vLLM (Marlin Kernel):

vllm serve quant-mind/Nex-N2.5-mini-W4A16-AutoRound \
    --port 8000 \
    --max-model-len 4096 \
    --reasoning-parser qwen3 \
    --gpu-memory-utilization 0.90

2. Com Transformers / AutoGPTQ:

from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

model_id = "quant-mind/Nex-N2.5-mini-W4A16-AutoRound"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    device_map="auto",
    torch_dtype=torch.bfloat16,
    trust_remote_code=True
)
Downloads last month
175
Safetensors
Model size
6B params
Tensor type
I32
·
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for quant-mind/Nex-N2.5-mini-W4A16-AutoRound

Quantized
(32)
this model