Preparação
288 × 192 pixels preparados e organizados em 216 patches de entrada.
Demonstração pública · dados pré-calculados
Uma leitura interativa de representações produzidas pela torre visual do Qwen3.5-9B, com os pesos congelados.
O padrão foi criado dentro da própria bancada. Nenhuma fotografia ou arquivo pessoal participa desta demonstração.
Execução pronta para exploração.
Percurso dos números
288 × 192 pixels preparados e organizados em 216 patches de entrada.
216 tokens, cada um com 1.152 coordenadas.
Parte fixa do modelo: reúne posições e projeta a representação.
54 tokens, cada um com 4.096 coordenadas.
Preparação visualizada
Os 288 × 192 pixels preparados formam uma grade de 18 × 12 células. Cada célula corresponde a um patch de 16 × 16 pixels antes da representação em tokens.
Exploração interativa
Estas escolhas recalculam somente a leitura analítica dos números já publicados. Elas não modificam o merger aprendido, não treinam pesos e não executam novamente o encoder.
Azul: valor positivo. Laranja: negativo. O sinal não representa acerto, erro ou confiança.
Passe o ponteiro ou use Tab nas barras para consultar os valores.
A linha liga valores pela ordem dos índices. A proximidade horizontal não significa proximidade de sentido.
Mova o ponteiro sobre a linha para consultar uma coordenada.
Como as escolhas de agregação e normalização transformam a visualização dos mesmos tokens salvos.
Uma coordenada isolada não identifica um objeto, conceito, qualidade da imagem ou explicação semântica.
Para executar com seus próprios arquivos
O repositório contém o código, as instruções de instalação e as condições técnicas para executar o encoder na sua própria máquina.