Bee-350M PT β€” variante 15B (fork de decaimento)

Este e' o gemeo experimental de BrCamp/bee-350m-pt-base. Mesma arquitetura, mesmo corpus, mesmo tokenizador, mesma forma de schedule β€” a unica coisa que difere e' o total de tokens: 15,00B aqui contra 21,75B no principal.

Ele existe porque foi bifurcado do checkpoint do run principal no passo 165.000 (com estado do Adam e posicao no dado), decaindo dali ate 15,00B enquanto o principal seguia no plato.

Por que ele importa

modelo tokens tok/param bpb
bee-350m-pt-base 21,75B 63 0,8207
este (15B) 15,00B 43 0,8223
bee-150m-pt-base 21,75B 143 0,8438

⭐ 45% mais dado renderam 0,19% de bpb. Ja ir de 151M para 345M parametros rendeu 2,76%. Nesta arquitetura o volume de tokens satura por volta de 43 tok/param β€” e a escala continua pagando.

⭐ E o mesmo modelo, nos mesmos 15,00B tokens, mede 0,9167 se colhido no plato do WSD e 0,8223 decaido: o decaimento de LR sozinho vale 10,3% de bpb. Comparar marcos intermediarios de modelos com schedules diferentes mede o schedule, nao o modelo.

Para que serve

Como modelo, ele e' ligeiramente pior que o principal β€” use o principal. Este aqui serve para reproduzir a ablacao: e' o unico ponto que permite isolar o efeito do volume de tokens com todo o resto fixo.

Detalhes: bpb medido.

Limitacoes

As mesmas do principal: modelo base, nao segue instrucoes, nao conversa, nao usa ferramentas; 345M parametros e 2048 de contexto alucinam fatos com facilidade; herda os vieses da web em portugues. bpb mede modelagem de linguagem, nao fluencia de resposta.

Downloads last month
271
Safetensors
Model size
0.3B params
Tensor type
F32
Β·
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support