Prévia Técnica

Uma arquitetura para executar modelos MoE.

Guardar de forma compacta. Usar o que precisa. Manter a origem pronta.

Um modelo de IA pode ter muitos especialistas, mesmo quando usa apenas alguns por vez. O Horizon RunMap organiza como eles são guardados, calculados e levados à GPU, a peça do computador que faz esses cálculos. Conheça a arquitetura, minhas decisões de engenharia e os resultados registrados.

Concebido e desenvolvido individualmente, com recursos limitados e sem financiamento institucional.

Ilustração de uma oficina: ferramentas sobre uma bancada, com muitas caixas nas estantes ao fundo.
Nem tudo precisa ficar na bancada ao mesmo tempo. Uma analogia para a memória.

01 / A ideia

Primeiro, a ideia. Depois, os nomes.

A bancada

A GPU faz os cálculos. A VRAM é o espaço de memória que ela usa.

O armazém

A RAM guarda a cópia completa e imutável dos especialistas.

As ferramentas

Especialistas são partes do modelo. Cada etapa usa alguns deles.

Imagine uma oficina: a bancada tem espaço limitado e as ferramentas ficam no armazém. Aqui, cada ferramenta representa um conjunto de cálculos do modelo.

Alguns modelos de IA contêm muitos especialistas. Cada etapa usa uma seleção deles, mas o modelo completo ainda precisa de um lugar para ficar.

Por que a memória importa? Veja o contexto de modelos grandes

Em modelos MoE, uma seleção de especialistas trabalha em cada token, enquanto o conjunto completo de parâmetros precisa ser armazenado. Compare a escala em BF16 com a representação publicada pelos projetos.

A dimensão da memória

O mesmo modelo. Dois cenários de memória.

GLM-5.3744 bilhões de parâmetros totais · 40 bilhões ativos por token

Comparação em BF16

16 bits · 2 bytes por parâmetro

Memória estimada dos pesos
1,49 TB
Mínimo matemático · somente pesos
9 B200
Capacidade para planejar a execução
16 B200
2 servidores de 8 GPUs

Cenário calculado com reserva de 20%–30% da memória total e servidores completos. Contexto e carga de trabalho orientam o dimensionamento final.

Formato publicado

FP8 · 8 bits

Memória idealizada dos pesos
744 GB
Mínimo matemático · somente pesos
5 B200
Referência para execução
8 B200 · configuração documentada

A receita do vLLM descreve pesos FP8 e KV cache FP8 para contexto de até 1 milhão de tokens. A concorrência é ajustada ao orçamento de memória.

FP8 é o checkpoint padrão; a Z.ai também publica uma versão BF16 separada.

Fontes verificadas em 13 de set. de 2026Especificação do modelo ↗Receita de execução vLLM ↗
Como chegamos a esses números

A comparação considera os pesos integralmente na memória das GPUs, com divisão ideal entre dispositivos. Pesos ≈ parâmetros totais × bits ÷ 8. Cada B200 oferece 180 GB nominais; cada servidor reúne 8 GPUs, totalizando 1,44 TB. GB e TB usam unidades decimais.

Mínimo de GPUs = pesos ÷ 180 GB, arredondado para cima. Servidores com reserva = pesos ÷ (1,44 TB × 0,80) até pesos ÷ (1,44 TB × 0,70), sempre arredondados para cima. A reserva é uma premissa de planejamento escolhida para esta comparação.

As contas usam parâmetros publicados arredondados, em vez do tamanho real dos arquivos. Escalas, tensores em precisão mista, buffers, KV cache (memória do contexto) e organização do paralelismo compõem o orçamento de execução. Quantidade de GPUs e velocidade de resposta são dimensões distintas.

Para GLM-5.3, usamos os 744 bilhões totais e 40 bilhões ativos declarados pela Z.ai. A receita do vLLM descreve aproximadamente 743/39 bilhões; essa diferença mantém o mesmo arredondamento das GPUs nesta comparação.

Capacidade do sistema B200 · NVIDIA ↗

Os modelos de fronteira mostram a escala do desafio de memória e de infraestrutura que motiva o Horizon RunMap. OLMoE e Qwen são os modelos usados para investigar armazenamento, transferência e execução no hardware disponível. A aplicação da arquitetura a escalas maiores exige validação própria; as taxas medidas abaixo pertencem à campanha identificada.

Referências de custo por plataforma

Ofertas registradas em 10/09/2026, por plataforma ou categoria de instância. A compra e o aluguel abaixo têm escopo próprio; uma implantação com vários servidores também depende da rede e dos serviços contratados.

NVIDIA B200 (180 GB product) · fontes e estimativas registradas

NVIDIA B200 (produto de 180 GB)

Contexto externo · estimativas · Verificado em 10 de set. de 2026

Lambda: por GPU-hora, conforme a categoria

USD 6,69–6,99 / GPU-hora

Estimativa de oferta publicada

Fórmula, premissas e limites1 GPU × USD 6.69 a 6.99/GPU-hora × 1 hora
  • Faixa publicada pela Lambda entre categorias de instância, sem representar o menor preço de todo o mercado ou uma oferta uniforme de GPU individual.
  • Categoria de oito GPUs: USD 6.69 por GPU; quatro GPUs: USD 6.79 por GPU; duas GPUs: USD 6.89 por GPU; uma GPU: USD 6.99.
  • Região não especificada na tabela; impostos sobre vendas/IVA/GST adicionais. Nenhuma disponibilidade foi reservada.
  • O menor valor exige uma instância com oito GPUs. Os recursos do computador dependem da categoria; armazenamento externo, rede e operação não foram precificados aqui.

Lambda (abre em nova aba)Fonte primária · Verificado em 10 de set. de 2026

Runpod: por GPU-hora, sob demanda

USD 6,79 / GPU-hora

Estimativa de oferta publicada

Fórmula, premissas e limites1 Runpod Secure Cloud B200 × USD 6.79/GPU-hora × 1 hora
  • Oferta publicada pela Runpod para Secure Cloud sob demanda; sem compromisso de prazo ou tarifa sem servidor.
  • Anunciada com 283 GB de RAM e 28 vCPUs. A região não é especificada no guia citado.
  • Armazenamento, rede, impostos e disponibilidade exigem verificação separada.

Runpod (abre em nova aba)Fonte primária · Verificado em 10 de set. de 2026

Lambda: mês hipotético, instância de oito GPUs

USD 38.534,4

Hipótese

Fórmula, premissas e limites8 GPUs × USD 6.69/GPU-hora × 720 horas = USD 38534.40
  • Uma instância Lambda de oito GPUs por um mês hipotético de 30 dias de aluguel contínuo.
  • O total horário correspondente da instância é 8 × USD 6.69 = USD 53.52.
  • Sem afirmação de que um modelo cabe ou pode ser implantado. Exclui impostos e serviços cobrados separadamente; região não especificada.

Lambda (abre em nova aba)Fonte primária · Verificado em 10 de set. de 2026

ITCT: uma plataforma com oito GPUs, em pré-venda

USD 390.000

Estimativa de oferta publicada

Fórmula, premissas e limites1 anunciada com oito GPUs HGX B200 plataforma × USD 390000/plataforma
  • Somente a oferta de pré-venda anunciada pela própria ITCT Shop; não é preço de GPU avulsa, fatura verificada ou orçamento completo de centro de dados.
  • A lista final de componentes e a região de entrega não foram estabelecidas. Não se afirma que CPU, RAM, armazenamento, extras do gabinete ou rede estejam incluídos.
  • Não há comprovação da inclusão de switches externos, cabos, eletricidade, refrigeração, trabalho operacional, frete ou impostos.
  • As tabelas de engenharia e afirmações publicitárias do vendedor não são usadas como evidência técnica; a especificação de capacidade vem da NVIDIA.
  • Esta é uma oferta atribuível, sem representar uma faixa de preços de aquisição do mercado ou uma garantia de entrega.

ITCT Shop (abre em nova aba)Fonte primária · Verificado em 10 de set. de 2026

NVIDIA (abre em nova aba)Fonte primária · Verificado em 10 de set. de 2026

NVIDIA (abre em nova aba)Fonte primária · Verificado em 10 de set. de 2026

Lambda (abre em nova aba)Fonte primária · Verificado em 10 de set. de 2026

Runpod (abre em nova aba)Fonte primária · Verificado em 10 de set. de 2026

ITCT Shop (abre em nova aba)Fonte primária · Verificado em 10 de set. de 2026

Capacidade de GPU, compra de plataforma, aluguel, rede, eletricidade, refrigeração e operação são planos de custo separados. Não há orçamento completo, custo total de propriedade ou recomendação de compra.

02 / A pergunta

Três decisões que trabalham juntas.

Quais pesos comprimir, como calculá-los e onde mantê-los? O Horizon trata essas decisões em conjunto. A residência completa e o offloading de especialistas são regimes dessa arquitetura.

Construí um runtime — o programa que coordena a execução do modelo — reunindo essas três decisões. Cada uma aparece abaixo com sua função e com o caminho para conhecer os detalhes.

01 / Guardar

Especialistas compactos

INT4

Os pesos dos especialistas escolhidos pelo roteamento ficam compactos na RAM e na GPU. Atenção, embeddings e os demais componentes ficam fora dessa quantização.

Pesos dos experts: INT4 · escalas: FP16

Entender os formatos

02 / Calcular

Executar no formato escolhido

W4A16

Kernels são as rotinas de cálculo na GPU. Os do Horizon usam os pesos compactos e convertem os valores necessários durante a operação, sem manter um especialista inteiro expandido.

Pesos compactos → kernel próprio + ativações FP16 → saída

Conhecer o caminho do cálculo

03 / Organizar

Trabalhar com cópias

RAM → GPU

A RAM conserva a origem completa. A GPU usa cópias de todos os especialistas ou de uma parte, conforme o espaço reservado. A origem segue pronta depois do descarte.

Origem imutável · cópias descartáveis na GPU

Ver acerto, falta e descarte

03 / Arquitetura

Uma arquitetura. Dois regimes de residência.

Residente significa guardado na memória da GPU. Nos dois casos, os especialistas usam pesos compactos INT4/qpacked e os kernels recebem ativações FP16 — os valores calculados pela etapa anterior. Cada medição identifica o executor utilizado.

Residência completa

Todos os especialistas roteados permanecem na GPU em formato compacto. Esse regime exercita a execução dos experts comprimidos, sem precisar buscar cópias ausentes durante a geração.

Memória da GPU

Residência parcial

Parte dos especialistas fica na GPU. Quando falta uma cópia solicitada, ela vem da RAM já quantizada. A remoção libera apenas a cópia na GPU; a origem em RAM continua pronta para uso futuro.

  1. RAMOrigem completa e imutável
  2. Área de transferênciaLimitada, no computador
  3. Memória da GPUCópias em cache
Ver os detalhes técnicos

No fluxo de residência parcial apresentado, a origem dos especialistas na RAM permanece completa e imutável. Uma cópia passa por uma área limitada de memória fixada (pinned staging) no computador, antes da transferência para a GPU. A remoção descarta a cópia na GPU, sem transferência de volta ou regravação na origem.

Residência não é ativação: o cache pode manter especialistas que não estão sendo usados nesta etapa. O diagrama explica a organização; a campanha abaixo mede residência parcial e completa, preservando as diferenças entre executores.

Uma cópia só entra no cache quando está pronta

Arquitetura documentada · resident-qpacked-cache-v1 · ADR 0009. Escopo original: P0 Qwen experimental, desativado por padrão. Os executores medidos abaixo são descritos em seus contratos específicos.

  1. Origem imutável

    O conjunto qpacked completo permanece na RAM do processo, com identidade e layout validados.

  2. Staging limitado

    Uma área pinned temporária prepara a transferência. Ela só pode ser reutilizada após a conclusão.

  3. Spare não publicado

    A linha qpacked chega a uma posição temporária da GPU; os leitores continuam vendo a geração anterior.

  4. Publicação atômica

    Após a conclusão do grupo roteado, uma transição publica a nova geração completa do cache.

  5. Uso e descarte

    Leitores usam uma geração válida. A cópia removida só é reutilizada após a aposentadoria de seus consumidores; a origem não é reescrita.

  6. Admissão de recursos

    Capacidade é fixada antes das requisições. Se staging ou spares forem insuficientes, a inicialização rejeita o perfil; falhas anteriores à publicação preservam a geração anterior.

Perfis anteriores têm outro contrato: offload-qpacked materializa slots de execução FP16/BF16 a partir de uma fonte quantizada. No cache qpacked descrito aqui, os experts permanecem compactos. O kernel converte os valores necessários durante o cálculo, sem manter o expert inteiro expandido em um slot. Essa conversão não recupera informação perdida na quantização.

Ler decisões, fontes e limites (inglês) ↓

04 / Observações registradas

A arquitetura colocada em execução.

A campanha com OLMoE e Qwen em uma RTX 5070 registra execuções com residência completa e parcial. As configurações mostram como o sistema operou dentro de cada contrato de memória, executor e carga de trabalho.

A arquitetura em operação · E3 exploratório

Especialistas compactos, executados com residência completa ou parcial.

Os registros abaixo mostram modelo, espaço para cópias e executor. As taxas descrevem a geração de texto em cada configuração.

Residência completa

OLMoE 0924

O Grouped T3 executa os especialistas compactos, com todos eles na GPU durante a geração.

64/64 especialistas por camada · Grouped T3

Registro de execução

61,26 tokens/s

Decode após o primeiro token

Inspecionar este resultado

Residência completa

OLMoE 0125

O Grouped T3 executa os especialistas compactos, com todos eles na GPU durante a geração.

64/64 especialistas por camada · Grouped T3

Registro de execução

62,07 tokens/s

Decode após o primeiro token

Inspecionar este resultado

Residência parcial

Qwen

O top4-fused-v1 executa os especialistas compactos com parte das cópias na GPU e transferências sob demanda.

39/60 especialistas por camada · top4-fused-v1

Registro de execução

19,95 tokens/s

Decode após o primeiro token

Inspecionar este resultado

Maior residência medida em cada modelo · RTX 5070 · 36 respostas de 128 tokens por configuração. OLMoE e Qwen usam executores distintos; cada cartão descreve sua própria execução.

E3 exploratório

468

respostas medidas · volume da campanha

39/39execuções válidas
13configurações
1h 50min 21sduração da campanha

36 respostas de 128 tokens por configuração · 12 entradas × 3 blocos · 39 warmups excluídos das taxas.

Como os números foram calculados

Decode divide a soma dos tokens após o primeiro pela soma dos tempos internos de geração. É uma taxa agregada, ponderada pelo tempo. A espera pelo primeiro token e a duração da resposta são médias por requisição, com limites internos específicos de cada executor.

Decode
37min 06s
Até o primeiro token
35min 10s
Demais etapas (por diferença)
38min 05s

Amplitude relativa observada entre os blocos: 0,27%–4,78%. É variação observada, não intervalo de confiança. Temperatura máxima registrada: 58 °C.

A consolidação registrou sequências de tokens iguais entre repetições da mesma configuração. Essa observação descreve consistência dentro de cada configuração; a avaliação de qualidade e a comparação de saídas entre configurações têm escopos próprios. O tempo das demais etapas é calculado por diferença na duração do controlador.

Explorar os resultados →

Tokens são pequenos pedaços de texto; nem sempre palavras inteiras.

05 / Memória e velocidade

Mais espaço na bancada. O que muda?

Escolha um modelo e uma medida para explorar as configurações registradas. Cada grupo identifica o executor, o caminho de cálculo usado naquela execução.

Modelo
E3 exploratório11 de set. de 2026

36 respostas por configuração · 128 tokens por resposta · 3 blocos

Hardware · NVIDIA GeForce RTX 5070, conforme o registro da campanha; computador Windows compartilhado.

Decode após o primeiro token · tokens/s
Taxa agregada: Σ(tokens − 1) / Σ(tempo interno de decode). Exclui a espera pelo primeiro token; não é média das taxas individuais.

Medições após aquecimento, com entradas fixas. Escopo da pesquisa

Especialistas residentes por camada · medições discretas, sem interpolação ou comparação entre modelos.

PRODUCT-core scalar

30/6423,00 tokens/s
40/6427,69 tokens/s
50/6431,50 tokens/s
60/6435,01 tokens/s

Grouped T3 · executor diferente

Entre c30–c60 (scalar) e c64 (Grouped T3), residência e executor mudam juntos. A diferença de velocidade não isola o custo do offloading nem o ganho do kernel.

64/6461,26 tokens/s
Ver as 13 configurações

A tabela contém todas as configurações. Em telas estreitas, role a tabela para os lados.

Campanha de 11/09/2026 · 36 respostas de 128 tokens por configuração · E3 exploratório
NVIDIA GeForce RTX 5070 (frozen campaign declaration); shared Windows desktop.
Decode = Σ(tokens − 1) / Σ(tempo interno de decode).
Modelo / executorExperts residentes por camadaDecode agregado após o primeiro token (tokens/s)TTFT interno — média (s)Resposta interna, 128 tokens — média (s)Pico VRAM¹ (GiB)Fonte
OLMoE 0924PRODUCT-core scalar30/6423,006,1711,694,11JSON
OLMoE 0924PRODUCT-core scalar40/6427,694,499,074,62JSON
OLMoE 0924PRODUCT-core scalar50/6431,503,627,655,15JSON
OLMoE 0924PRODUCT-core scalar60/6435,013,006,635,67JSON
OLMoE 0924Grouped T364/6461,260,752,825,99JSON
OLMoE 0125PRODUCT-core scalar30/6423,046,0711,584,15JSON
OLMoE 0125PRODUCT-core scalar40/6427,124,539,214,62JSON
OLMoE 0125PRODUCT-core scalar50/6431,223,597,665,15JSON
OLMoE 0125PRODUCT-core scalar60/6435,442,976,555,67JSON
OLMoE 0125Grouped T364/6462,070,702,746,01JSON
Qwentop4-fused-v120/6015,229,4217,767,11JSON
Qwentop4-fused-v130/6017,177,5114,908,08JSON
Qwentop4-fused-v139/6019,955,8012,178,99JSON

¹ VRAM observada pelo driver durante o worker inteiro, incluindo preparação, warmup e uso compartilhado pelo desktop. Não é VRAM exclusiva do processo ou apenas do decode.

OLMoE 0924 · 30/64 · PRODUCT-core scalar contrato e medidas adicionais
Métrica
Taxa agregada: soma dos tokens após o primeiro / soma dos tempos internos de decode. Exclui espera pelo primeiro token, preparação e aquecimento; não é a média das taxas individuais.
Modelo / revisão
allenai/OLMoE-1B-7B-0924-Instruct
Executor
PRODUCT-core scalar
Armazenamento / execução
INT4 / block 256 / FP16 scales. Valores FP16 derivados da fonte quantizada. A precisão e os valores do checkpoint original são registrados separadamente; o detalhe disponível continua limitado à representação quantizada.
Pico de RAM do processo (worker inteiro)
4,95 GiB
Transferência RAM → GPU (soma das respostas medidas)
1.108,10 GiB
Taxas dos três blocos
23,12 / 23,14 / 22,74 tokens/s
Amplitude relativa observada (não é intervalo de confiança)
1,74%
Taxa de saída incluindo espera pelo primeiro token
10,95 tokens/s
Hardware
NVIDIA GeForce RTX 5070, conforme o registro da campanha; computador Windows compartilhado.
Contrato da execução
PERF-REAL-v1; 12 entradas repetidas em 3 blocos; 36 respostas medidas de 128 tokens por configuração; seleção gulosa, EOS suprimido; aquecimento de 64 tokens excluído. Posicionamento inicial canônico, LRU evolui pelas entradas fixas; concorrência 1.
Data da execução
11 de set. de 2026
Revisão do modelo
7f1c97f440f06ce36705e4f2b843edb5925f4498
Artefato original (caminho relativo ao repositório)
artifacts/residency-executors-39-20260911-01/consolidation-01/summary.json

Contexto desta observação

  • E3 exploratório em computador compartilhado. Avaliação de qualidade e validação E4 permanecem em aberto.
  • Picos de VRAM do driver e RSS do processo cobrem o worker inteiro, incluindo preparação e aquecimento; a VRAM inclui o uso do desktop.
  • A passagem do OLMoE c60 para c64 combina mudanças de executor e residência; o resultado deve ser interpretado nesse contexto conjunto.
  • A amplitude dos blocos é uma faixa observada, não um intervalo de confiança. A igualdade de tokens refere-se às repetições de cada configuração.
  • Primeiro token e resposta usam limites internos da requisição; prefill isolado é UNKNOWN e a observação HTTP do OLMoE é UNSUPPORTED.
Baixar extrato selecionado (JSON)

Extrato da campanha com identificadores e textos originais em inglês. O pacote completo e as observações brutas têm disponibilidade própria.

OLMoE 0924 · 40/64 · PRODUCT-core scalar contrato e medidas adicionais
Métrica
Taxa agregada: soma dos tokens após o primeiro / soma dos tempos internos de decode. Exclui espera pelo primeiro token, preparação e aquecimento; não é a média das taxas individuais.
Modelo / revisão
allenai/OLMoE-1B-7B-0924-Instruct
Executor
PRODUCT-core scalar
Armazenamento / execução
INT4 / block 256 / FP16 scales. Valores FP16 derivados da fonte quantizada. A precisão e os valores do checkpoint original são registrados separadamente; o detalhe disponível continua limitado à representação quantizada.
Pico de RAM do processo (worker inteiro)
4,95 GiB
Transferência RAM → GPU (soma das respostas medidas)
576,17 GiB
Taxas dos três blocos
27,76 / 27,63 / 27,69 tokens/s
Amplitude relativa observada (não é intervalo de confiança)
0,45%
Taxa de saída incluindo espera pelo primeiro token
14,11 tokens/s
Hardware
NVIDIA GeForce RTX 5070, conforme o registro da campanha; computador Windows compartilhado.
Contrato da execução
PERF-REAL-v1; 12 entradas repetidas em 3 blocos; 36 respostas medidas de 128 tokens por configuração; seleção gulosa, EOS suprimido; aquecimento de 64 tokens excluído. Posicionamento inicial canônico, LRU evolui pelas entradas fixas; concorrência 1.
Data da execução
11 de set. de 2026
Revisão do modelo
7f1c97f440f06ce36705e4f2b843edb5925f4498
Artefato original (caminho relativo ao repositório)
artifacts/residency-executors-39-20260911-01/consolidation-01/summary.json

Contexto desta observação

  • E3 exploratório em computador compartilhado. Avaliação de qualidade e validação E4 permanecem em aberto.
  • Picos de VRAM do driver e RSS do processo cobrem o worker inteiro, incluindo preparação e aquecimento; a VRAM inclui o uso do desktop.
  • A passagem do OLMoE c60 para c64 combina mudanças de executor e residência; o resultado deve ser interpretado nesse contexto conjunto.
  • A amplitude dos blocos é uma faixa observada, não um intervalo de confiança. A igualdade de tokens refere-se às repetições de cada configuração.
  • Primeiro token e resposta usam limites internos da requisição; prefill isolado é UNKNOWN e a observação HTTP do OLMoE é UNSUPPORTED.
Baixar extrato selecionado (JSON)

Extrato da campanha com identificadores e textos originais em inglês. O pacote completo e as observações brutas têm disponibilidade própria.

OLMoE 0924 · 50/64 · PRODUCT-core scalar contrato e medidas adicionais
Métrica
Taxa agregada: soma dos tokens após o primeiro / soma dos tempos internos de decode. Exclui espera pelo primeiro token, preparação e aquecimento; não é a média das taxas individuais.
Modelo / revisão
allenai/OLMoE-1B-7B-0924-Instruct
Executor
PRODUCT-core scalar
Armazenamento / execução
INT4 / block 256 / FP16 scales. Valores FP16 derivados da fonte quantizada. A precisão e os valores do checkpoint original são registrados separadamente; o detalhe disponível continua limitado à representação quantizada.
Pico de RAM do processo (worker inteiro)
4,95 GiB
Transferência RAM → GPU (soma das respostas medidas)
230,88 GiB
Taxas dos três blocos
31,75 / 31,57 / 31,19 tokens/s
Amplitude relativa observada (não é intervalo de confiança)
1,75%
Taxa de saída incluindo espera pelo primeiro token
16,73 tokens/s
Hardware
NVIDIA GeForce RTX 5070, conforme o registro da campanha; computador Windows compartilhado.
Contrato da execução
PERF-REAL-v1; 12 entradas repetidas em 3 blocos; 36 respostas medidas de 128 tokens por configuração; seleção gulosa, EOS suprimido; aquecimento de 64 tokens excluído. Posicionamento inicial canônico, LRU evolui pelas entradas fixas; concorrência 1.
Data da execução
11 de set. de 2026
Revisão do modelo
7f1c97f440f06ce36705e4f2b843edb5925f4498
Artefato original (caminho relativo ao repositório)
artifacts/residency-executors-39-20260911-01/consolidation-01/summary.json

Contexto desta observação

  • E3 exploratório em computador compartilhado. Avaliação de qualidade e validação E4 permanecem em aberto.
  • Picos de VRAM do driver e RSS do processo cobrem o worker inteiro, incluindo preparação e aquecimento; a VRAM inclui o uso do desktop.
  • A passagem do OLMoE c60 para c64 combina mudanças de executor e residência; o resultado deve ser interpretado nesse contexto conjunto.
  • A amplitude dos blocos é uma faixa observada, não um intervalo de confiança. A igualdade de tokens refere-se às repetições de cada configuração.
  • Primeiro token e resposta usam limites internos da requisição; prefill isolado é UNKNOWN e a observação HTTP do OLMoE é UNSUPPORTED.
Baixar extrato selecionado (JSON)

Extrato da campanha com identificadores e textos originais em inglês. O pacote completo e as observações brutas têm disponibilidade própria.

OLMoE 0924 · 60/64 · PRODUCT-core scalar contrato e medidas adicionais
Métrica
Taxa agregada: soma dos tokens após o primeiro / soma dos tempos internos de decode. Exclui espera pelo primeiro token, preparação e aquecimento; não é a média das taxas individuais.
Modelo / revisão
allenai/OLMoE-1B-7B-0924-Instruct
Executor
PRODUCT-core scalar
Armazenamento / execução
INT4 / block 256 / FP16 scales. Valores FP16 derivados da fonte quantizada. A precisão e os valores do checkpoint original são registrados separadamente; o detalhe disponível continua limitado à representação quantizada.
Pico de RAM do processo (worker inteiro)
4,96 GiB
Transferência RAM → GPU (soma das respostas medidas)
37,62 GiB
Taxas dos três blocos
35,47 / 34,72 / 34,85 tokens/s
Amplitude relativa observada (não é intervalo de confiança)
2,14%
Taxa de saída incluindo espera pelo primeiro token
19,31 tokens/s
Hardware
NVIDIA GeForce RTX 5070, conforme o registro da campanha; computador Windows compartilhado.
Contrato da execução
PERF-REAL-v1; 12 entradas repetidas em 3 blocos; 36 respostas medidas de 128 tokens por configuração; seleção gulosa, EOS suprimido; aquecimento de 64 tokens excluído. Posicionamento inicial canônico, LRU evolui pelas entradas fixas; concorrência 1.
Data da execução
11 de set. de 2026
Revisão do modelo
7f1c97f440f06ce36705e4f2b843edb5925f4498
Artefato original (caminho relativo ao repositório)
artifacts/residency-executors-39-20260911-01/consolidation-01/summary.json

Contexto desta observação

  • E3 exploratório em computador compartilhado. Avaliação de qualidade e validação E4 permanecem em aberto.
  • Picos de VRAM do driver e RSS do processo cobrem o worker inteiro, incluindo preparação e aquecimento; a VRAM inclui o uso do desktop.
  • A passagem do OLMoE c60 para c64 combina mudanças de executor e residência; o resultado deve ser interpretado nesse contexto conjunto.
  • A amplitude dos blocos é uma faixa observada, não um intervalo de confiança. A igualdade de tokens refere-se às repetições de cada configuração.
  • Primeiro token e resposta usam limites internos da requisição; prefill isolado é UNKNOWN e a observação HTTP do OLMoE é UNSUPPORTED.
Baixar extrato selecionado (JSON)

Extrato da campanha com identificadores e textos originais em inglês. O pacote completo e as observações brutas têm disponibilidade própria.

OLMoE 0924 · 64/64 · Grouped T3 contrato e medidas adicionais
Métrica
Taxa agregada: soma dos tokens após o primeiro / soma dos tempos internos de decode. Exclui espera pelo primeiro token, preparação e aquecimento; não é a média das taxas individuais.
Modelo / revisão
allenai/OLMoE-1B-7B-0924-Instruct
Executor
Grouped T3
Armazenamento / execução
INT4 / block 256 / FP16 scales. Valores FP16 derivados da fonte quantizada. A precisão e os valores do checkpoint original são registrados separadamente; o detalhe disponível continua limitado à representação quantizada.
Pico de RAM do processo (worker inteiro)
4,98 GiB
Transferência RAM → GPU (soma das respostas medidas)
0,00 GiB
Taxas dos três blocos
59,72 / 62,65 / 61,47 tokens/s
Amplitude relativa observada (não é intervalo de confiança)
4,78%
Taxa de saída incluindo espera pelo primeiro token
45,41 tokens/s
Hardware
NVIDIA GeForce RTX 5070, conforme o registro da campanha; computador Windows compartilhado.
Contrato da execução
PERF-REAL-v1; 12 entradas repetidas em 3 blocos; 36 respostas medidas de 128 tokens por configuração; seleção gulosa, EOS suprimido; aquecimento de 64 tokens excluído. Posicionamento inicial canônico, LRU evolui pelas entradas fixas; concorrência 1.
Data da execução
11 de set. de 2026
Revisão do modelo
7f1c97f440f06ce36705e4f2b843edb5925f4498
Artefato original (caminho relativo ao repositório)
artifacts/residency-executors-39-20260911-01/consolidation-01/summary.json

Contexto desta observação

  • E3 exploratório em computador compartilhado. Avaliação de qualidade e validação E4 permanecem em aberto.
  • Picos de VRAM do driver e RSS do processo cobrem o worker inteiro, incluindo preparação e aquecimento; a VRAM inclui o uso do desktop.
  • A passagem do OLMoE c60 para c64 combina mudanças de executor e residência; o resultado deve ser interpretado nesse contexto conjunto.
  • A amplitude dos blocos é uma faixa observada, não um intervalo de confiança. A igualdade de tokens refere-se às repetições de cada configuração.
  • Primeiro token e resposta usam limites internos da requisição; prefill isolado é UNKNOWN e a observação HTTP do OLMoE é UNSUPPORTED.
Baixar extrato selecionado (JSON)

Extrato da campanha com identificadores e textos originais em inglês. O pacote completo e as observações brutas têm disponibilidade própria.

OLMoE 0125 · 30/64 · PRODUCT-core scalar contrato e medidas adicionais
Métrica
Taxa agregada: soma dos tokens após o primeiro / soma dos tempos internos de decode. Exclui espera pelo primeiro token, preparação e aquecimento; não é a média das taxas individuais.
Modelo / revisão
allenai/OLMoE-1B-7B-0125-Instruct
Executor
PRODUCT-core scalar
Armazenamento / execução
INT4 / block 256 / FP16 scales. Valores FP16 derivados da fonte quantizada. A precisão e os valores do checkpoint original são registrados separadamente; o detalhe disponível continua limitado à representação quantizada.
Pico de RAM do processo (worker inteiro)
4,97 GiB
Transferência RAM → GPU (soma das respostas medidas)
1.115,87 GiB
Taxas dos três blocos
22,65 / 22,98 / 23,51 tokens/s
Amplitude relativa observada (não é intervalo de confiança)
3,74%
Taxa de saída incluindo espera pelo primeiro token
11,05 tokens/s
Hardware
NVIDIA GeForce RTX 5070, conforme o registro da campanha; computador Windows compartilhado.
Contrato da execução
PERF-REAL-v1; 12 entradas repetidas em 3 blocos; 36 respostas medidas de 128 tokens por configuração; seleção gulosa, EOS suprimido; aquecimento de 64 tokens excluído. Posicionamento inicial canônico, LRU evolui pelas entradas fixas; concorrência 1.
Data da execução
11 de set. de 2026
Revisão do modelo
b89a7c4bc24fb9e55ce2543c9458ce0ca5c4650e
Artefato original (caminho relativo ao repositório)
artifacts/residency-executors-39-20260911-01/consolidation-01/summary.json

Contexto desta observação

  • E3 exploratório em computador compartilhado. Avaliação de qualidade e validação E4 permanecem em aberto.
  • Picos de VRAM do driver e RSS do processo cobrem o worker inteiro, incluindo preparação e aquecimento; a VRAM inclui o uso do desktop.
  • A passagem do OLMoE c60 para c64 combina mudanças de executor e residência; o resultado deve ser interpretado nesse contexto conjunto.
  • A amplitude dos blocos é uma faixa observada, não um intervalo de confiança. A igualdade de tokens refere-se às repetições de cada configuração.
  • Primeiro token e resposta usam limites internos da requisição; prefill isolado é UNKNOWN e a observação HTTP do OLMoE é UNSUPPORTED.
Baixar extrato selecionado (JSON)

Extrato da campanha com identificadores e textos originais em inglês. O pacote completo e as observações brutas têm disponibilidade própria.

OLMoE 0125 · 40/64 · PRODUCT-core scalar contrato e medidas adicionais
Métrica
Taxa agregada: soma dos tokens após o primeiro / soma dos tempos internos de decode. Exclui espera pelo primeiro token, preparação e aquecimento; não é a média das taxas individuais.
Modelo / revisão
allenai/OLMoE-1B-7B-0125-Instruct
Executor
PRODUCT-core scalar
Armazenamento / execução
INT4 / block 256 / FP16 scales. Valores FP16 derivados da fonte quantizada. A precisão e os valores do checkpoint original são registrados separadamente; o detalhe disponível continua limitado à representação quantizada.
Pico de RAM do processo (worker inteiro)
4,95 GiB
Transferência RAM → GPU (soma das respostas medidas)
580,72 GiB
Taxas dos três blocos
27,21 / 26,75 / 27,42 tokens/s
Amplitude relativa observada (não é intervalo de confiança)
2,47%
Taxa de saída incluindo espera pelo primeiro token
13,90 tokens/s
Hardware
NVIDIA GeForce RTX 5070, conforme o registro da campanha; computador Windows compartilhado.
Contrato da execução
PERF-REAL-v1; 12 entradas repetidas em 3 blocos; 36 respostas medidas de 128 tokens por configuração; seleção gulosa, EOS suprimido; aquecimento de 64 tokens excluído. Posicionamento inicial canônico, LRU evolui pelas entradas fixas; concorrência 1.
Data da execução
11 de set. de 2026
Revisão do modelo
b89a7c4bc24fb9e55ce2543c9458ce0ca5c4650e
Artefato original (caminho relativo ao repositório)
artifacts/residency-executors-39-20260911-01/consolidation-01/summary.json

Contexto desta observação

  • E3 exploratório em computador compartilhado. Avaliação de qualidade e validação E4 permanecem em aberto.
  • Picos de VRAM do driver e RSS do processo cobrem o worker inteiro, incluindo preparação e aquecimento; a VRAM inclui o uso do desktop.
  • A passagem do OLMoE c60 para c64 combina mudanças de executor e residência; o resultado deve ser interpretado nesse contexto conjunto.
  • A amplitude dos blocos é uma faixa observada, não um intervalo de confiança. A igualdade de tokens refere-se às repetições de cada configuração.
  • Primeiro token e resposta usam limites internos da requisição; prefill isolado é UNKNOWN e a observação HTTP do OLMoE é UNSUPPORTED.
Baixar extrato selecionado (JSON)

Extrato da campanha com identificadores e textos originais em inglês. O pacote completo e as observações brutas têm disponibilidade própria.

OLMoE 0125 · 50/64 · PRODUCT-core scalar contrato e medidas adicionais
Métrica
Taxa agregada: soma dos tokens após o primeiro / soma dos tempos internos de decode. Exclui espera pelo primeiro token, preparação e aquecimento; não é a média das taxas individuais.
Modelo / revisão
allenai/OLMoE-1B-7B-0125-Instruct
Executor
PRODUCT-core scalar
Armazenamento / execução
INT4 / block 256 / FP16 scales. Valores FP16 derivados da fonte quantizada. A precisão e os valores do checkpoint original são registrados separadamente; o detalhe disponível continua limitado à representação quantizada.
Pico de RAM do processo (worker inteiro)
4,95 GiB
Transferência RAM → GPU (soma das respostas medidas)
235,35 GiB
Taxas dos três blocos
31,10 / 31,31 / 31,25 tokens/s
Amplitude relativa observada (não é intervalo de confiança)
0,66%
Taxa de saída incluindo espera pelo primeiro token
16,71 tokens/s
Hardware
NVIDIA GeForce RTX 5070, conforme o registro da campanha; computador Windows compartilhado.
Contrato da execução
PERF-REAL-v1; 12 entradas repetidas em 3 blocos; 36 respostas medidas de 128 tokens por configuração; seleção gulosa, EOS suprimido; aquecimento de 64 tokens excluído. Posicionamento inicial canônico, LRU evolui pelas entradas fixas; concorrência 1.
Data da execução
11 de set. de 2026
Revisão do modelo
b89a7c4bc24fb9e55ce2543c9458ce0ca5c4650e
Artefato original (caminho relativo ao repositório)
artifacts/residency-executors-39-20260911-01/consolidation-01/summary.json

Contexto desta observação

  • E3 exploratório em computador compartilhado. Avaliação de qualidade e validação E4 permanecem em aberto.
  • Picos de VRAM do driver e RSS do processo cobrem o worker inteiro, incluindo preparação e aquecimento; a VRAM inclui o uso do desktop.
  • A passagem do OLMoE c60 para c64 combina mudanças de executor e residência; o resultado deve ser interpretado nesse contexto conjunto.
  • A amplitude dos blocos é uma faixa observada, não um intervalo de confiança. A igualdade de tokens refere-se às repetições de cada configuração.
  • Primeiro token e resposta usam limites internos da requisição; prefill isolado é UNKNOWN e a observação HTTP do OLMoE é UNSUPPORTED.
Baixar extrato selecionado (JSON)

Extrato da campanha com identificadores e textos originais em inglês. O pacote completo e as observações brutas têm disponibilidade própria.

OLMoE 0125 · 60/64 · PRODUCT-core scalar contrato e medidas adicionais
Métrica
Taxa agregada: soma dos tokens após o primeiro / soma dos tempos internos de decode. Exclui espera pelo primeiro token, preparação e aquecimento; não é a média das taxas individuais.
Modelo / revisão
allenai/OLMoE-1B-7B-0125-Instruct
Executor
PRODUCT-core scalar
Armazenamento / execução
INT4 / block 256 / FP16 scales. Valores FP16 derivados da fonte quantizada. A precisão e os valores do checkpoint original são registrados separadamente; o detalhe disponível continua limitado à representação quantizada.
Pico de RAM do processo (worker inteiro)
4,96 GiB
Transferência RAM → GPU (soma das respostas medidas)
40,81 GiB
Taxas dos três blocos
35,45 / 35,49 / 35,39 tokens/s
Amplitude relativa observada (não é intervalo de confiança)
0,27%
Taxa de saída incluindo espera pelo primeiro token
19,54 tokens/s
Hardware
NVIDIA GeForce RTX 5070, conforme o registro da campanha; computador Windows compartilhado.
Contrato da execução
PERF-REAL-v1; 12 entradas repetidas em 3 blocos; 36 respostas medidas de 128 tokens por configuração; seleção gulosa, EOS suprimido; aquecimento de 64 tokens excluído. Posicionamento inicial canônico, LRU evolui pelas entradas fixas; concorrência 1.
Data da execução
11 de set. de 2026
Revisão do modelo
b89a7c4bc24fb9e55ce2543c9458ce0ca5c4650e
Artefato original (caminho relativo ao repositório)
artifacts/residency-executors-39-20260911-01/consolidation-01/summary.json

Contexto desta observação

  • E3 exploratório em computador compartilhado. Avaliação de qualidade e validação E4 permanecem em aberto.
  • Picos de VRAM do driver e RSS do processo cobrem o worker inteiro, incluindo preparação e aquecimento; a VRAM inclui o uso do desktop.
  • A passagem do OLMoE c60 para c64 combina mudanças de executor e residência; o resultado deve ser interpretado nesse contexto conjunto.
  • A amplitude dos blocos é uma faixa observada, não um intervalo de confiança. A igualdade de tokens refere-se às repetições de cada configuração.
  • Primeiro token e resposta usam limites internos da requisição; prefill isolado é UNKNOWN e a observação HTTP do OLMoE é UNSUPPORTED.
Baixar extrato selecionado (JSON)

Extrato da campanha com identificadores e textos originais em inglês. O pacote completo e as observações brutas têm disponibilidade própria.

OLMoE 0125 · 64/64 · Grouped T3 contrato e medidas adicionais
Métrica
Taxa agregada: soma dos tokens após o primeiro / soma dos tempos internos de decode. Exclui espera pelo primeiro token, preparação e aquecimento; não é a média das taxas individuais.
Modelo / revisão
allenai/OLMoE-1B-7B-0125-Instruct
Executor
Grouped T3
Armazenamento / execução
INT4 / block 256 / FP16 scales. Valores FP16 derivados da fonte quantizada. A precisão e os valores do checkpoint original são registrados separadamente; o detalhe disponível continua limitado à representação quantizada.
Pico de RAM do processo (worker inteiro)
4,96 GiB
Transferência RAM → GPU (soma das respostas medidas)
0,00 GiB
Taxas dos três blocos
62,69 / 61,39 / 62,15 tokens/s
Amplitude relativa observada (não é intervalo de confiança)
2,10%
Taxa de saída incluindo espera pelo primeiro token
46,67 tokens/s
Hardware
NVIDIA GeForce RTX 5070, conforme o registro da campanha; computador Windows compartilhado.
Contrato da execução
PERF-REAL-v1; 12 entradas repetidas em 3 blocos; 36 respostas medidas de 128 tokens por configuração; seleção gulosa, EOS suprimido; aquecimento de 64 tokens excluído. Posicionamento inicial canônico, LRU evolui pelas entradas fixas; concorrência 1.
Data da execução
11 de set. de 2026
Revisão do modelo
b89a7c4bc24fb9e55ce2543c9458ce0ca5c4650e
Artefato original (caminho relativo ao repositório)
artifacts/residency-executors-39-20260911-01/consolidation-01/summary.json

Contexto desta observação

  • E3 exploratório em computador compartilhado. Avaliação de qualidade e validação E4 permanecem em aberto.
  • Picos de VRAM do driver e RSS do processo cobrem o worker inteiro, incluindo preparação e aquecimento; a VRAM inclui o uso do desktop.
  • A passagem do OLMoE c60 para c64 combina mudanças de executor e residência; o resultado deve ser interpretado nesse contexto conjunto.
  • A amplitude dos blocos é uma faixa observada, não um intervalo de confiança. A igualdade de tokens refere-se às repetições de cada configuração.
  • Primeiro token e resposta usam limites internos da requisição; prefill isolado é UNKNOWN e a observação HTTP do OLMoE é UNSUPPORTED.
Baixar extrato selecionado (JSON)

Extrato da campanha com identificadores e textos originais em inglês. O pacote completo e as observações brutas têm disponibilidade própria.

Qwen · 20/60 · top4-fused-v1 contrato e medidas adicionais
Métrica
Taxa agregada: soma dos tokens após o primeiro / soma dos tempos internos de decode. Exclui espera pelo primeiro token, preparação e aquecimento; não é a média das taxas individuais.
Modelo / revisão
Qwen/Qwen1.5-MoE-A2.7B-Chat
Executor
top4-fused-v1
Armazenamento / execução
INT4 / block 256 / FP16 scales. Valores FP16 derivados da fonte quantizada. A precisão e os valores do checkpoint original são registrados separadamente; o detalhe disponível continua limitado à representação quantizada.
Pico de RAM do processo (worker inteiro)
7,97 GiB
Transferência RAM → GPU (soma das respostas medidas)
2.702,75 GiB
Taxas dos três blocos
15,08 / 15,03 / 15,56 tokens/s
Amplitude relativa observada (não é intervalo de confiança)
3,49%
Taxa de saída incluindo espera pelo primeiro token
7,21 tokens/s
Hardware
NVIDIA GeForce RTX 5070, conforme o registro da campanha; computador Windows compartilhado.
Contrato da execução
PERF-REAL-v1; 12 entradas repetidas em 3 blocos; 36 respostas medidas de 128 tokens por configuração; seleção gulosa, EOS suprimido; aquecimento de 64 tokens excluído. Posicionamento inicial canônico, LRU evolui pelas entradas fixas; concorrência 1.
Data da execução
11 de set. de 2026
Revisão do modelo
ec052fda178e241c7c443468d2fa1db6618996be
Artefato original (caminho relativo ao repositório)
artifacts/residency-executors-39-20260911-01/consolidation-01/summary.json

Contexto desta observação

  • E3 exploratório em computador compartilhado. Avaliação de qualidade e validação E4 permanecem em aberto.
  • Picos de VRAM do driver e RSS do processo cobrem o worker inteiro, incluindo preparação e aquecimento; a VRAM inclui o uso do desktop.
  • A passagem do OLMoE c60 para c64 combina mudanças de executor e residência; o resultado deve ser interpretado nesse contexto conjunto.
  • A amplitude dos blocos é uma faixa observada, não um intervalo de confiança. A igualdade de tokens refere-se às repetições de cada configuração.
  • Primeiro token e resposta usam limites internos da requisição; prefill isolado é UNKNOWN e a observação HTTP do OLMoE é UNSUPPORTED.
Baixar extrato selecionado (JSON)

Extrato da campanha com identificadores e textos originais em inglês. O pacote completo e as observações brutas têm disponibilidade própria.

Qwen · 30/60 · top4-fused-v1 contrato e medidas adicionais
Métrica
Taxa agregada: soma dos tokens após o primeiro / soma dos tempos internos de decode. Exclui espera pelo primeiro token, preparação e aquecimento; não é a média das taxas individuais.
Modelo / revisão
Qwen/Qwen1.5-MoE-A2.7B-Chat
Executor
top4-fused-v1
Armazenamento / execução
INT4 / block 256 / FP16 scales. Valores FP16 derivados da fonte quantizada. A precisão e os valores do checkpoint original são registrados separadamente; o detalhe disponível continua limitado à representação quantizada.
Pico de RAM do processo (worker inteiro)
7,99 GiB
Transferência RAM → GPU (soma das respostas medidas)
1.852,07 GiB
Taxas dos três blocos
17,45 / 17,02 / 17,04 tokens/s
Amplitude relativa observada (não é intervalo de confiança)
2,51%
Taxa de saída incluindo espera pelo primeiro token
8,59 tokens/s
Hardware
NVIDIA GeForce RTX 5070, conforme o registro da campanha; computador Windows compartilhado.
Contrato da execução
PERF-REAL-v1; 12 entradas repetidas em 3 blocos; 36 respostas medidas de 128 tokens por configuração; seleção gulosa, EOS suprimido; aquecimento de 64 tokens excluído. Posicionamento inicial canônico, LRU evolui pelas entradas fixas; concorrência 1.
Data da execução
11 de set. de 2026
Revisão do modelo
ec052fda178e241c7c443468d2fa1db6618996be
Artefato original (caminho relativo ao repositório)
artifacts/residency-executors-39-20260911-01/consolidation-01/summary.json

Contexto desta observação

  • E3 exploratório em computador compartilhado. Avaliação de qualidade e validação E4 permanecem em aberto.
  • Picos de VRAM do driver e RSS do processo cobrem o worker inteiro, incluindo preparação e aquecimento; a VRAM inclui o uso do desktop.
  • A passagem do OLMoE c60 para c64 combina mudanças de executor e residência; o resultado deve ser interpretado nesse contexto conjunto.
  • A amplitude dos blocos é uma faixa observada, não um intervalo de confiança. A igualdade de tokens refere-se às repetições de cada configuração.
  • Primeiro token e resposta usam limites internos da requisição; prefill isolado é UNKNOWN e a observação HTTP do OLMoE é UNSUPPORTED.
Baixar extrato selecionado (JSON)

Extrato da campanha com identificadores e textos originais em inglês. O pacote completo e as observações brutas têm disponibilidade própria.

Qwen · 39/60 · top4-fused-v1 contrato e medidas adicionais
Métrica
Taxa agregada: soma dos tokens após o primeiro / soma dos tempos internos de decode. Exclui espera pelo primeiro token, preparação e aquecimento; não é a média das taxas individuais.
Modelo / revisão
Qwen/Qwen1.5-MoE-A2.7B-Chat
Executor
top4-fused-v1
Armazenamento / execução
INT4 / block 256 / FP16 scales. Valores FP16 derivados da fonte quantizada. A precisão e os valores do checkpoint original são registrados separadamente; o detalhe disponível continua limitado à representação quantizada.
Pico de RAM do processo (worker inteiro)
7,97 GiB
Transferência RAM → GPU (soma das respostas medidas)
1.172,50 GiB
Taxas dos três blocos
20,31 / 19,78 / 19,76 tokens/s
Amplitude relativa observada (não é intervalo de confiança)
2,74%
Taxa de saída incluindo espera pelo primeiro token
10,52 tokens/s
Hardware
NVIDIA GeForce RTX 5070, conforme o registro da campanha; computador Windows compartilhado.
Contrato da execução
PERF-REAL-v1; 12 entradas repetidas em 3 blocos; 36 respostas medidas de 128 tokens por configuração; seleção gulosa, EOS suprimido; aquecimento de 64 tokens excluído. Posicionamento inicial canônico, LRU evolui pelas entradas fixas; concorrência 1.
Data da execução
11 de set. de 2026
Revisão do modelo
ec052fda178e241c7c443468d2fa1db6618996be
Artefato original (caminho relativo ao repositório)
artifacts/residency-executors-39-20260911-01/consolidation-01/summary.json

Contexto desta observação

  • E3 exploratório em computador compartilhado. Avaliação de qualidade e validação E4 permanecem em aberto.
  • Picos de VRAM do driver e RSS do processo cobrem o worker inteiro, incluindo preparação e aquecimento; a VRAM inclui o uso do desktop.
  • A passagem do OLMoE c60 para c64 combina mudanças de executor e residência; o resultado deve ser interpretado nesse contexto conjunto.
  • A amplitude dos blocos é uma faixa observada, não um intervalo de confiança. A igualdade de tokens refere-se às repetições de cada configuração.
  • Primeiro token e resposta usam limites internos da requisição; prefill isolado é UNKNOWN e a observação HTTP do OLMoE é UNSUPPORTED.
Baixar extrato selecionado (JSON)

Extrato da campanha com identificadores e textos originais em inglês. O pacote completo e as observações brutas têm disponibilidade própria.

06 / Acompanhe um token

Um pedaço de texto. Uma sequência de decisões.

Tokens são pequenos pedaços de texto. O modelo os processa em camadas; o roteamento escolhe os especialistas que participam de cada etapa. O runtime coordena os recursos que tornam essa execução possível.

Da entrada à resposta: acompanhe como o trabalho se organiza. O diagrama seguinte mostra o que acontece com as cópias dos especialistas. Ver acerto, falta e descarte

  1. Ler a entrada

    O texto é dividido em tokens e processado pelo modelo.

  2. Selecionar especialistas

    O roteamento escolhe especialistas em cada camada roteada.

  3. Consultar o cache

    Se a cópia está na GPU, ela pode ser usada. Se falta, vem da RAM pela área de transferência.

  4. Produzir o próximo token

    Os cálculos das camadas contribuem para a próxima saída. O processo se repete.

07 / De volta à oficina

O armazém continua intacto.

O armazém guarda o conjunto completo dos especialistas. A bancada usa cópias. Veja três situações de um mesmo mecanismo: o cache, que mantém cópias prontas na memória da GPU.

Uma origem completa. Cópias para trabalhar.

Em todas as situações, os especialistas compactos continuam guardados na RAM. Essa é a origem imutável.

Acerto

Usar a cópia pronta

RAMOrigem intacta
Já está na GPU
GPUCópia disponível

O especialista solicitado já tem uma cópia pronta na bancada. O cálculo usa essa cópia.

A origem fica intacta; essa consulta dispensa uma nova transferência do especialista.

Falta

Trazer uma cópia

RAMOrigem intacta
Copiar para a GPU
GPUCópia recebida

A cópia solicitada vem da RAM pela área de transferência. Ela fica disponível para uso quando a transferência termina e o novo estado completo do cache é publicado.

A origem permanece pronta na RAM, inclusive depois da transferência.

Descarte

Liberar espaço

RAMOrigem intacta
Liberar na GPU
GPUCópia liberada

Quando pode ser liberada com segurança, a cópia sai da bancada. A posição só é reutilizada depois que os cálculos que usam essa cópia terminam.

A origem segue pronta para uma próxima cópia; os pesos não precisam voltar à CPU.

Três situações possíveis, não uma sequência obrigatória. O desenho explica o mecanismo; quantidades e tempos são informados nos resultados de cada configuração.
Conhecer a transferência e a publicação do cache →

08 / Precisão e qualidade

Precisão também é uma decisão de engenharia.

Na arquitetura qpacked apresentada, os pesos dos especialistas roteados permanecem compactos em INT4 na RAM e na GPU. Os kernels usam ativações FP16: W4A16 descreve esses dois formatos. Os demais componentes do modelo ficam fora dessa quantização INT4.

O formato guardado, o formato usado durante o cálculo e a precisão da soma são decisões distintas. Os pesos compactos são convertidos dentro do kernel conforme o cálculo precisa deles; o especialista inteiro não ocupa um slot permanente expandido.

Guardar

W4: pesos dos experts roteados em INT4, com escalas FP16. O cache da GPU conserva esse formato compacto.

Calcular

A16: ativações FP16. Os kernels convertem pesos durante o cálculo e têm etapas de acumulação FP32 e arredondamentos explícitos. W4A16 não descreve sozinho toda a aritmética.

Demais componentes

Atenção, embeddings, roteamento e demais componentes ficam fora do INT4. Na campanha, os pesos não roteados são materializados em FP16 a partir do checkpoint BF16.

09 / Trabalhos relacionados

Diferentes maneiras de compartilhar a memória.

O Horizon faz parte de um campo mais amplo de organização da memória. Estes projetos movimentam unidades diferentes de trabalho, usam a CPU de formas distintas e atendem a cargas diferentes.

Este mapa compara decisões de arquitetura: o que cada projeto armazena, movimenta e calcula. Uma comparação de desempenho entre runtimes exige um experimento próprio com checkpoint, precisão, hardware e carga de trabalho comparáveis.

10 / Como ler as evidências

Uma pesquisa com escopo definido.

Esta apresentação reúne a arquitetura, as decisões de engenharia e uma campanha de testes com OLMoE e Qwen em computador compartilhado. Os resultados têm nível E3 exploratório: registram memória, transferências e tempos nas configurações informadas.

A qualidade das respostas ainda não foi avaliada. Sequências mais longas, crescimento da memória de contexto (KV cache), outros modelos e equipamentos, uso em produção e identificação causal de gargalos exigem investigações próprias. Esses são os limites das conclusões desta campanha.

Perguntas para ler a pesquisa

Como interpretar os resultados?

As taxas registram como o Horizon operou nas configurações publicadas. Uma comparação de desempenho com outro runtime é uma pergunta de pesquisa própria: exige checkpoint, precisão, hardware, entradas e geração comparáveis.

Quais dados explicam o cache?

H2D é o volume transferido do computador para a GPU. O explorador apresenta o total registrado nas respostas medidas. Acertos, faltas e custo por falta exigem contadores e tempos próprios; esse volume sozinho não determina essas medidas.

O que posso verificar nos downloads?

Os arquivos permitem conferir integridade e consistência entre os dados publicados. Reproduzir o experimento completo exige também código, ambiente e observações brutas suficientes. O bloco de auditoria descreve o material compartilhado e a disponibilidade do código.

Consultar o material disponível →
O alcance desta campanha

Esta página reúne OLMoE 0924, OLMoE 0125 e Qwen. Cada configuração usa 12 entradas em três blocos, com respostas de 128 tokens.

Verificações curtas e séries históricas usam condições diferentes e ficam separadas desta campanha. Cada conjunto de arquivos identifica suas condições de execução.

Desconhecido (UNKNOWN) significa informação ausente ou não medida. Não suportado (UNSUPPORTED) significa que a plataforma ou dependência não oferece a observação.

Baixar guia de auditoria desta edição

Guia desta edição em inglês.

11 / Engenharia

Da pergunta ao runtime: as escolhas de quem constrói.

Concebi e desenvolvo o Horizon individualmente, conectando pesquisa, implementação e análise dos resultados. Trabalhar com recursos limitados exige escolher o que construir, como verificar cada decisão e onde concentrar o próximo esforço.

A trajetória parte da pesquisa do NeuronMap e evolui em um runtime próprio, com a procedência do código reutilizado registrada. As decisões abaixo mostram essa direção de engenharia; os contratos da campanha identificam as configurações efetivamente medidas.

A memória é um orçamento

Problema · Uma etapa ativa poucos especialistas, mas o conjunto de pesos precisa continuar acessível.

Decisão de engenharia · Distinguir armazenamento, residência e execução; declarar a capacidade por camada e por perfil.

Como interpretar · Essa decisão torna explícito quanto espaço cada configuração reserva para os especialistas.

Notas técnicas · contratos de backend

Publicar apenas estado completo

Problema · Substituir uma cópia em uso exige preservar a autoridade dos pesos e dos leitores do cache.

Decisão de engenharia · Manter a origem em RAM imutável, preparar as novas cópias em posições temporárias da GPU e tornar o novo estado do cache visível de uma só vez, após a transferência.

Como interpretar · Os cálculos recebem um conjunto completo de cópias prontas para uso, enquanto a origem em RAM permanece intacta.

Notas técnicas · ADR 0009

Separar as variáveis na leitura

Problema · No OLMoE, c60 e c64 mudam residência e executor ao mesmo tempo.

Decisão de engenharia · Manter os resultados disponíveis, separar o ponto Grouped T3 e explicitar o contrato ao lado da medição.

Como interpretar · A leitura considera as duas mudanças em conjunto. As taxas dos três blocos mostram a variação registrada; isolar o efeito causal da residência requer outro desenho experimental.

Relatório da campanha selecionada

Esta é a apresentação da pesquisa: arquitetura, decisões técnicas e registros de execução do Horizon.

12 / Contato

Conheça quem está construindo o Horizon.

O projeto reúne o trabalho que quero levar a novas oportunidades: investigar problemas de sistemas de IA, construir soluções e avaliar resultados. Estou aberto a conversas técnicas, colaboração e oportunidades profissionais.

Lucas Ribeiro

Criador do Horizon RunMap · pesquisa independente

Uma pessoa conectando pesquisa, engenharia e experimentação.

Sou Lucas Ribeiro. Concebi e desenvolvo o Horizon individualmente, com recursos limitados e sem financiamento institucional. O projeto reúne meu trabalho de investigação, construção do runtime e análise dos experimentos.

Quero levar essa capacidade de construir e investigar a desafios de sistemas de IA, em colaboração com pessoas e organizações que valorizem engenharia cuidadosa e iniciativa.

Como auditar estes dados

Esta edição reúne extratos curados da campanha já realizada. Você pode conferir a integridade dos arquivos e a consistência entre cada extrato e o conjunto de agregados.

Edição · technical-preview-residency39-v1

Executar a verificação no seu computador
  1. Siga o guia para baixar o manifesto e seus 19 arquivos em uma pasta nova, mantendo os nomes. Há um comando PowerShell para baixar a edição completa.
  2. Com Node.js 22.19.0, execute dentro dessa pasta:
node verify-evidence-edition.mjs --directory .

PASS confirma os hashes de 19 arquivos e a concordância das 13 cópias de agregados. O verificador usa apenas arquivos locais, sem instalar dependências ou executar modelos.

A verificação cobre a integridade dos arquivos e a consistência dos agregados desta edição. A reprodução do experimento e o recálculo a partir de observações brutas exigem o material completo e um procedimento próprio. Os hashes conferem os arquivos contra o manifesto fornecido; a autenticação do publicador é uma verificação distinta.

O código do runtime permanece privado por decisão do autor. Esta apresentação compartilha a arquitetura, as decisões de engenharia e os resultados documentados. Os downloads incluem extratos, relatório, notas técnicas e verificador.

Consultar a edição atual e os dois extratos históricos ↓