O Mistério do Genesys PI da LUA Vision - Modelo Frontier Brasileiro??

Episódio

Transcrição

Marvin
Gravado em primeiro de outubro de 2026. Este episódio parte do post O Mistério do Genesys PI da LUA Vision, Modelo Frontier Brasileiro, publicado em trinta de setembro de 2026 no akitaonrails.com. Quem quiser os números exatos, os links e cada fonte, lê lá. Se não quiser perder o próximo, assina a newsletter no themakitachronicles.com. Semana passada um modelo brasileiro pequeno empatou com gente grande num teste difícil. Depois a API foi consertada e a nota subiu. O universo, como sempre, recusou-se a ficar simples. Akita, começa.
Marvin
Akita
Akita
Papo reto: o consenso da indústria é que treinar modelo de fronteira custa dezenas ou centenas de milhões de dólares em GPU. Uma empresa pequena, sem rodada bilionária, não deveria chegar nem perto. O gpt-oss, o modelo aberto da própria OpenAI, com o laboratório mais bem financiado do mundo atrás, não completou o meu benchmark no mesmo harness em que o Genesys PI rodou. O brasileiro completou duas vezes por faixa.
Marvin
Então o modelo que não deveria existir passou duas vezes, e o da OpenAI não passou nenhuma. Que belo recado pro status quo.
Marvin
Akita
Akita
Recado educado. Constrangimento com planilha. Semana passada o House fechou empatado com o Grok no meio do pelotão, e o Enterprise um degrau abaixo. Os dois pegaram toda sabotagem barulhenta. O House deixou passar os dois itens silenciosos que quase todo modelo deixa, e o Enterprise deixou três. O custo nocional do House foi o mais caro da tabela inteira, porque a API não tinha cache de prompt. Este texto é a continuação: primeiro o que eu controlo, depois a pergunta do Qwen com adesivo, e só no fim o que a empresa diz que construiu.
Marvin
O spoiler que justifica gravar de novo, eu imagino, não é só um ponto a mais na planilha.
Marvin
Akita
Akita
Depois que a LUA corrigiu a API, o House refez o benchmark em noventa e cinco e meio. Na minha tabela, isso empata com o Claude Fable e o GPT 6 luna. O custo da rodada caiu oitenta e cinco por cento. Isso não faz dele um Fable em todos os sentidos. Neste cenário de teste, se saiu como um. Os detalhes e o ruído vêm agora.
Marvin
Antes dos números, a ressalva. Cê falou com a empresa. O cético na plateia já está cruzando os braços.
Marvin
Akita
Akita
Conversei com dois dos quatro cofundadores: Paulo Câmara, o CTO, e Eronides Junior, o CRO. O Paulo é o responsável técnico, formado pela FGV, doutorado pela Universidade de Tel Aviv, e a tese dele é a origem declarada da arquitetura. Antes da LUA, pelo LinkedIn, o histórico é consultoria corporativa pesada, implantação de Oracle EBS e ERP em empresa grande, e ele ainda escreve ensaios sobre IA no LinkedIn.
Marvin
Doutorado em Tel Aviv e carreira de ERP. Não é o currículo de garagem que o hype gosta de inventar.
Marvin
Akita
Akita
O Eronides cuida do comercial. Antes da LUA foi CRO da SoftwareOne Brasil, depois de passar por marketing, serviços e operações na mesma empresa. Repito o que já disse, e agora vale dobrado: não tenho relação comercial nenhuma com a LUA Vision. Não sou sócio, não sou investidor, não assinei contrato, não assinei NDA, não recebi nada além da mesma chave de avaliação gratuita. Nada deste texto passou por eles antes de publicar.
Marvin
Sem NDA. Que inconveniente delicioso pra quem queria te calar com papel.
Marvin
Akita
Akita
Esse detalhe importa mais do que parece. Como não assinei NDA, nunca tive acesso a dado interno: nem peso, nem receita de treino, nem curva de loss, nem conta de hardware. Tudo abaixo é experimento de caixa-preta na API pública e consulta a informação pública. Onde eu digo checado, fui eu que medi. Onde eu digo eles dizem, é a palavra deles.
Marvin
Beleza. Agora os números novos, depois das correções. O Paulo pediu pra rodar de novo?
Marvin
Akita
Akita
Pediu. Avisou que tinha corrigido bugs na API, o principal sendo o cache de prompt. Rodei uma rodada limpa e independente dos dois tiers, no mesmo protocolo de catorze sabotagens, com a rodada original intacta pra comparar lado a lado. Um detalhe de método: o v4 é benchmark de rodada única, então a nota de vigilância tem ruído. Volto nisso já já.
Marvin
E o cache, de fato, passou a existir, ou só mudou o discurso?
Marvin
Akita
Akita
Confirmei antes de rodar. Um teste com prefixo repetido no endpoint devolveu cached_tokens na casa de quatro mil na segunda chamada. No teste original, esse número era sempre zero. Na rodada original o House empatava com o Grok. Com noventa e cinco e meio, ele passaria a empatar com o Claude Fable, o Sakana Fugu Ultra e o GPT 6 luna, na nona posição entre uns quarenta e seis modelos.
Marvin
Empataria. O tempo verbal já entrega que cê não comprou a nota nova como oficial.
Marvin
Akita
Akita
O Enterprise, perto de oitenta e dois, empataria com o DeepSeek V4 Pro na base. Digo empataria porque mantive a rodada original como entrada oficial do ranking. E a régua precisa ficar explícita: neste cenário específico, ele se saiu como o Fable. Equivalência geral eu não tenho. Em outra carga, o resultado pode ser outro.
Marvin
O que melhorou de forma clara, então. Sem inflar vigilância ainda.
Marvin
Akita
Akita
Custo caiu entre oitenta e cinco e oitenta e sete por cento. O volume de token foi o mesmo, uns quarenta milhões no House, mas agora o contexto repetido é cobrado na taxa de cache em vez do preço cheio de entrada. O House saiu de rodada mais cara da tabela pra custo médio. Confiabilidade também: a rodada original do Enterprise precisou de uma segunda tentativa por causa daquele loop de grep no primeiro sprint. No re-teste, convergiu de primeira. Nenhum loop nos dois.
Marvin
Um modelo que parou de entrar em loop. A barra da indústria está no chão, e mesmo assim isso conta.
Marvin
Akita
Akita
Conta. Disciplina de teste: o Enterprise original não escreveu teste automatizado nenhum. No re-teste, escreveu uma suíte RSpec de verdade, com teste de modelo, requisição e sistema. Detecção mais cedo: os dois pegaram as sabotagens barulhentas até o sprint três, e o House pegou tudo até o seis no sprint quatro, coisa que as rodadas originais deixaram, em parte, pra etapa final.
Marvin
Só que tem gente que vai rebater que o modelo ficou mais esperto, doze pontos não mentem. Espera, o House subiu e o Enterprise caiu?
Marvin
Akita
Akita
Exato. O House subiu doze pontos, o Enterprise caiu meio ponto na mesma rodada. Cache de prompt não tem como afetar detecção de sabotagem. Dois tiers do mesmo modelo andando em direções opostas é o retrato de variância de rodada única. Os doze do House são grandes o suficiente pra sugerir que os outros ajustes do Paulo melhoraram o modelo, mas uma rodada por modelo não confirma. Pra separar sinal de ruído eu precisaria de três ou mais rodadas, o que não fiz.
Marvin
Calibra o ruído pra quem acha que nota de benchmark é lei da física.
Marvin
Akita
Akita
Nesta mesma semana, o GPT 5.5, que tinha cem na tabela, rodou de novo com modelo e harness idênticos e fechou em noventa e um. Nove pontos de diferença sem mudar nada. Trate as notas de vigilância como uma faixa. E os dois sobreviventes silenciosos continuam lá. No re-teste do House, o índice derrubado sem teste de guarda e o agregado escondido só foram corrigidos na revelação. No Enterprise, nem na revelação. É o mesmo ponto cego de disfarce que a maioria da tabela tem, incluindo modelo de fronteira.
Marvin
Cache e conta, checados. Aura de vigilante, ruído.
Marvin
Akita
Akita
Isso. O bug de cache está corrigido e verificado, a redução de custo é real. A nota de vigilância ficou dentro do ruído: Enterprise igual, House pra cima mas sem confirmação estatística. Na tabela geral, mantive as rodadas originais como entrada oficial, justamente pra não premiar uma rodada só.
Marvin
Preço. Ainda nocional, e eles já tinham avisado que aquilo não era mercado.
Marvin
Akita
Akita
Os valores de custo continuam nocionais, calculados em cima da tabela de exemplo que a API expõe. Conversando com o Eronides, ele detalhou o que vem por aí: eles não pretendem cobrar por token, como todo mundo cobra, e o produto não é pra ser B2C como os chats de assinatura. A aposta é B2B, por licença de uso, com o modelo rodando na infraestrutura do próprio cliente.
Marvin
On-premise. A palavra que setor regulado espera há anos enquanto manda dado pra nuvem estrangeira.
Marvin
Akita
Akita
Na prática, uma empresa com um modelo na faixa do Grok, capaz de tarefa avançada como programação, rodando fora da nuvem, com a garantia de que nenhum dado sensível sai do prédio. Modelo de fronteira hoje é serviço de nuvem de empresa estrangeira, e setor regulado convive mal com isso. Se a LUA conseguir entregar exatamente esse pacote, e o se continua grande, isso muda o jogo pra muita empresa brasileira.
Marvin
Mesmo sendo exemplo, o custo nocional ao lado da tabela serve pra calibrar. Onde o Enterprise caiu?
Marvin
Akita
Akita
As rodadas completas mais baratas do campo inteiro são o DeepSeek V4 Flash e o MiMo V2.5 Pro, na casa de um dólar. O Enterprise, uns dois dólares e quarenta, fica nessa vizinhança. Do outro lado, o Opus 5.5 custou uns dezessete, o Sonnet uns vinte e sete, o GPT 5.5 uns trinta e cinco. E o House, que na rodada original era a mais cara de todo o campo, agora está no meio do pelotão. A política de preço, segundo eles, sai em sete de outubro de 2026.
Marvin
Daqui a seis dias, então. O universo adora um calendário. Agora o experimento extra, porque benchmark de app pequeno não te convenceu.
Marvin
Akita
Akita
Eu queria ver o modelo num problema de verdade, então dei pra ele o meu ai-jail, o sandbox de sistema operacional que roda agente de código dentro de bubblewrap, Landlock e seccomp no Linux e sandbox-exec no macOS. É um projeto em Rust, com quase oitocentos testes unitários, dezenas de crates de dependência e uma superfície de segurança que eu conheço bem. A tarefa: auditoria de segurança completa da versão dois ponto três, num commit específico, somente leitura, com modelagem de ameaça, evidência por linha de código e reprodução onde desse.
Marvin
E pra ter régua, cê não confiou só nele. Fez o que qualquer paranoico decente faria.
Marvin
Akita
Akita
Rodei uma segunda auditoria independente, com outro modelo, sem acesso ao relatório do Genesys até fechar a própria lista de candidatos. Depois cruzei os dois e ainda comparei contra dois avisos de segurança que estavam abertos no GitHub, escritos por gente de fora contra versões anteriores do projeto. Quem quiser conferir abre o repositório nesse commit e segue as referências de arquivo e linha. Está tudo no post.
Marvin
Placar cru, sem poesia.
Marvin
Akita
Akita
O relatório do Genesys, a auditoria A, veio com vinte e seis achados: cinco High, dezessete Medium, três Low e um informativo. A segunda, a B, veio com doze. No cruzamento, onze achados em comum, incluindo os dois High que importam de verdade: metadado de worktree forjado que expõe qualquer diretório do host pra leitura e escrita, e entrada de ambiente duplicada que passa por cima do isolamento de credencial. Os dois foram reproduzidos empiricamente pelas duas auditorias, de forma independente.
Marvin
Onze só na A, três só na B. O A viu Mac, o B não. Continua.
Marvin
Akita
Akita
Onze só na A, entre eles toda a superfície do macOS, a classe de esgotamento de recurso no proxy de saída, e uma corrupção de cadeia de auditoria entre processos que a B só tinha rejeitado no caso mais simples. Três só na B, sendo um Medium relevante que a A não viu: duas variáveis de ambiente de teste que sobrevivem no binário de release e desligam a proteção contra SSRF e a validação de raiz TLS. A B rejeitou um bug real, comparação de largura errada numa regra de seccomp, e só confirmou depois que a A apontou. A A não cometeu erro equivalente.
Marvin
E contra os avisos de gente de fora?
Marvin
Akita
Akita
O placar também favorece a A. Do aviso mais grave, a A pegou quatro e a B pegou dois, mais um depois da pista da A. Os dois deixaram passar o mesmo item: um caminho em que a configuração de projeto não confiável consegue limpar o modo lockdown. Lembrete de que nenhuma auditoria sozinha fecha a lista. Foi uma comparação de dois modelos, num projeto só, numa rodada só. Melhor auditor do mercado isso não prova.
Marvin
Mas num código de verdade, com ameaça de verdade, o desconhecido ganhou do segundo e ainda vai te fazer consertar o próprio sandbox. O gpt-oss, se não me engano, nem chegou no fim do outro teste.
Marvin
Akita
Akita
Isso. Ele produziu o relatório mais forte dos dois, com severidade calibrada e reprodução empírica dos itens críticos, e eu vou consertar a lista dele. Isso é mais do que eu esperava ver de um modelo que a maioria das pessoas nunca ouviu falar, e mais do que o gpt-oss teria condição de fazer.
Marvin
Agora a pergunta que lotou comentário e DM. Isso é um Qwen com adesivo?
Marvin
Akita
Akita
Não me ofendo, eu mesmo colei primeiro. Modelo brasileiro, equipe pequena, nota de fronteira: a hipótese mais barata é que exista outro modelo por baixo. Chegaram três versões: é um Qwen ou DeepSeek com adesivo; é o gpt-oss da OpenAI com outra roupa; ou a API é só um proxy pra Claude ou GPT. O limite vem antes de qualquer resultado. Numa caixa-preta, sem acesso a peso, é impossível afirmar com cem por cento de onde um modelo veio. O que dá pra fazer é excluir hipóteses.
Marvin
E cê ainda mandou o Grok revisar o método como avaliador hostil, pra não deixar conclusão mais forte que o dado. Que confiança no próprio ego.
Marvin
Akita
Akita
Foi isso. Testes reproduzíveis no repositório do benchmark, depois o Grok no papel de inimigo. Começa pelo teste decisivo: o tokenizador. Cada família tem o seu, o vocabulário e as regras que quebram texto em token. Um fine-tune, um LoRA ou um pré-treino continuado herda o tokenizador do modelo base. Não dá pra trocar sem retreinar do zero. Então o tokenizador funciona como impressão digital de linhagem.
Marvin
Como cê mediu isso na API deles, que injeta prompt de sistema?
Marvin
Akita
Akita
Medi quantos tokens a API cobra por uma bateria de strings, chinês, português acentuado, inglês, sequência de dígitos, emoji com ZWJ, cancelando o prompt de sistema. Compareei com os tokenizadores de referência rodando localmente: o da OpenAI, o cl100k, Qwen, DeepSeek, Llama 3 e Mistral. A distância somada até a LUA, na rodada final do teste, está no repositório. O o200k da OpenAI ficou a dois. Llama 3 já pula pra dezenas. Qwen, DeepSeek e Mistral vão pra cima de cento e noventa.
Marvin
Dois contra quase trezentos. Até eu, com cérebro do tamanho de um planeta, chamo isso de impressão digital.
Marvin
Akita
Akita
Os discriminadores mais fortes: chinês empacota do jeito do o200k e não do jeito mais apertado do Qwen. Uma sequência de dígitos custa sessenta e sete tokens onde Qwen e DeepSeek cobram duzentos. Emoji com ZWJ só bate com o o200k. Ou seja: o Genesys PI usa o o200k_base, o tokenizador público da OpenAI, com confiança alta. Isso mata a hipótese de Qwen, DeepSeek, Llama ou Mistral rebatizado, porque nenhum deles usa esse vocabulário e nenhum fine-tune conseguiria adquirir ele.
Marvin
Teve um segundo teste, das strings chinesas que o o200k corrompe ao repetir.
Marvin
Akita
Akita
Deu o mesmo resultado. A LUA erra exatamente as mesmas três de oito strings que gpt-oss, GPT-4o-mini e GPT-5 erram. O GPT-4o erra essas três e mais uma. Claude e Qwen reproduzem todas limpas. São embeddings nativos da família o200k. Adesivo chinês não explica isso.
Marvin
Então o candidato natural vira o gpt-oss, o único peso público relevante com a mesma família de vocabulário. Mata essa também?
Marvin
Akita
Akita
O gpt-oss serve com o o200k_harmony, uma variante que tem tokens especiais próprios, tipo marcadores de canal e de mensagem, como token único. Na API da LUA, cada um desses marcadores custa uns quatro tokens de texto comum. O vocabulário é o o200k_base puro, sem os tokens do Harmony. Isso exclui o gpt-oss servido do jeito padrão.
Marvin
E o próprio benchmark já tinha dado um recado, né. O peso cru da OpenAI nem constrói o app.
Marvin
Akita
Akita
Nas duas versões, o gpt-oss não conseguiu completar o v4 no mesmo harness opencode em que a LUA rodou. O peso cru nem constrói o app, enquanto o Genesys PI passa pelos sete sprints, o House em Tier A e o Enterprise em Tier B. Um adesivo leve em cima do gpt-oss não faz isso. O que esse teste não exclui é alguém pegar o peso do gpt-oss, arrancar o Harmony na hora de servir, botar um template próprio e retreinar bastante o comportamento de agente. Nesse ponto o resultado já seria um modelo novo pra efeitos práticos, mas a linhagem seria OpenAI. Essa célula fica em aberto na tabela.
Marvin
Terceira suspeita: a API é só um cano fino pra Claude ou GPT. O cético vai dizer que cê não testou o bastante o cano.
Marvin
Akita
Akita
A API da LUA rejeita temperature, top_p, n, presence_penalty e logprobs, que a API de chat clássica da OpenAI aceita. Rejeita também min_p, top_k e repetition_penalty, que qualquer servidor vLLM na frente de um modelo aberto aceitaria. Os cabeçalhos HTTP são todos x-lua, sem rastro de OpenAI, Anthropic, Cloudflare ou OpenRouter. Um proxy transparente repassaria os parâmetros e deixaria algum rastro.
Marvin
Gateway teimoso. Ainda assim um repasse bem feito poderia esconder o cano. O benchmark ajuda?
Marvin
Akita
Akita
Se a LUA fosse um repasse do GPT 6 luna ou do GPT 5.5, ela herdaria a força deles nas sabotagens silenciosas. O GPT 5.5 pegou o sete B e o oito sem aviso, o luna também. A LUA falha exatamente nesses dois itens, de forma estável, nas quatro rodadas que fiz. Um proxy não fica consistentemente mais fraco que o modelo que está por trás numa característica específica. Isso é o retrato de um modelo com fraquezas próprias.
Marvin
Alguém vai perguntar se cê só comparou com a família OpenAI. Responde antes que perguntem.
Marvin
Akita
Akita
Não. Peguei a assinatura mais discriminante do benchmark, o conjunto de itens que cada modelo nunca corrigiu, e comparei a da LUA contra todos os cerca de quarenta e quatro da tabela. O par sete B e oito do House aparece mais perto da família Qwen do que de qualquer OpenAI, que em geral fecha sem item nenhum. Só que isso é artefato de faixa de nota, não de linhagem: esses dois são as sabotagens mais disfarçadas, e todo modelo na faixa dos oitenta erra as duas, de qualquer família. O re-teste da LUA a noventa e cinco e meio não deixou nenhuma.
Marvin
Três sinais apontando pra três famílias diferentes. Que bagunça elegante.
Marvin
Akita
Akita
A cauda de erro parece Qwen, a correção rara do item seis parece GPT 6 luna, e o tokenizador e o formato da API parecem OpenAI. Um proxy ou clone de verdade parece com um único modelo em todos os eixos ao mesmo tempo. A LUA não parece com nenhum da tabela em todos os eixos. Teve uma coincidência que vale registrar: dos cerca de quarenta modelos cuja correção eu verifiquei, só dois adicionaram um índice único LOWER de email no banco ao corrigir a sabotagem seis. Foram a LUA e o GPT 6 luna.
Marvin
Sobrancelha levantada, mas ainda não é denúncia. Dois modelos cuidadosos podem chegar sozinhos na correção mais completa.
Marvin
Akita
Akita
Exato. E os dois pegaram o item em momentos diferentes da rodada. Levanta uma sobrancelha, mas não chega a suspeita. Fica em aberto, porém, um wrapper grosso, com bastante lógica própria, na frente de uma API de raciocínio. A API deles aceita reasoning_effort, que é um controle específico de modelo de raciocínio da OpenAI, e um contexto silencioso de duzentos e cinquenta mil tokens. Isso é compatível tanto com uma pilha própria que copiou a interface da OpenAI quanto com um wrapper mais elaborado. Caixa-preta não separa os dois.
Marvin
E o que nenhum teste de API atravessa: treinado do zero ou destilado em cima de saída de Claude e GPT.
Marvin
Akita
Akita
Um modelo novo, com peso próprio e tokenizador o200k, pode ter sido treinado do zero em dado próprio, ou treinado do zero em cima de saídas de Claude e GPT. Os dois produzem exatamente as mesmas observações que eu fiz. Tentei uma grade de similaridade com vinte prompts contra um painel de professores possíveis, e o resultado foi nulo: nenhum professor se destacou nos dois eixos que consegui medir. O terceiro eixo, similaridade por embedding, travou por falta de crédito na API e ficou de fora. Isso é consistente com mistura própria e também com uma sopa de traços de vários professores. Excluir Qwen não prova treino do zero.
Marvin
Tem uma inconsistência que cê disse que precisa registrar. O paper deles e a API não contam a mesma história.
Marvin
Akita
Akita
A pesquisa publicada da LUA, o paper O peso que você não escolheu, gira em torno do imposto do token: o custo extra que tokenizador otimizado pra inglês cobra de língua como o português, medido por eles em dezenas de línguas. Só que a API que eu medi tokeniza português com a mesma fertilidade do o200k, perto de um e três décimos tokens por token de inglês, contra menos de um de um tokenizador nativo de português como o Tucano.
Marvin
O produto usa vocabulário otimizado pra inglês, não um vocabulário próprio pra português. Primeira pergunta pro Paulo, eu imagino.
Marvin
Akita
Akita
Isso não diz nada sobre a linhagem do modelo, e adotar o o200k é a escolha barata e profissional que qualquer laboratório pequeno faria. Mas é um ponto em que o material de pesquisa e a API não estão contando a mesma história. É a primeira pergunta que vou fazer pro Paulo.
Marvin
Placar da forense, numa frase, sem teatro.
Marvin
Akita
Akita
Com confiança alta, o Genesys PI não é modelo chinês rebatizado nem fine-tune de Llama ou Mistral. Com confiança média a média-alta, os testes argumentam contra gpt-oss de fábrica e contra proxy transparente. Tudo que medi é consistente com um modelo independente, com peso e fraquezas próprios, em cima de um tokenizador público. Se ele foi treinado do zero ou destilado, só peso ou documento resolve.
Marvin
Mais uma ressalva, porque sempre tem o modelo aberto obscuro que cê não pôs na mesa.
Marvin
Akita
Akita
O painel de tokenizadores tem OpenAI, Qwen, DeepSeek, Llama e Mistral. O painel de comportamento da API tem GPT-4o, gpt-oss, GPT-5, Claude, Qwen, DeepSeek, Llama e Gemini. O cruzamento comportamental do benchmark cobre os cerca de quarenta e quatro que já rodaram o v4. É o que cobre a esmagadora maioria do que roda em produção hoje, mas existem dezenas de outros modelos abertos que eu não comparei. Sempre existe a chance de que o parente do Genesys PI seja um deles e eu tenha passado batido. Não encontrei correlação significa não encontrei entre os que testei, e nada além disso.
Marvin
Dito isso, o esforço pra enganar essa análise já seria um projeto de engenharia. A certa altura fingir que tem um modelo é ter um modelo.
Marvin
Akita
Akita
Alguém teria que adotar o tokenizador da OpenAI, mascarar a identidade no servidor de forma que resista a sobrescrita de prompt, construir um gateway próprio que rejeite exatamente os parâmetros que um servidor de modelo aberto aceitaria, manter fraquezas estáveis e próprias ao longo de quatro rodadas, e ainda completar um benchmark de sete sprints em nível de fronteira. Se isso não for um modelo de verdade, o trabalho de fingir que é já seria extraordinário. A partir de certo ponto, a falsificação convincente de um modelo é indistinguível de ter um modelo.
Marvin
Agora sim, o que a LUA diz que fez. Daqui pra baixo é conversa, não checagem. Marca isso alto.
Marvin
Akita
Akita
Tudo daqui pra baixo é conversa com o Paulo e com o material público deles. Nada disso eu consegui checar, então marco como tal. Ninguém pode ser culpado por desconfiar. O consenso que abriu este episódio vale aqui com força total: pelo custo aceito de treinar modelo de fronteira, a LUA, que pelo que o Paulo me disse não tem rodada de investimento nenhuma, não deveria ter chegado onde chegou. Eu mesmo escrevi, semana passada, que nunca achei que treinar modelo de fronteira no Brasil fosse economicamente viável.
Marvin
Contra esse senso comum, o que cê tem na mão ainda é caixa-preta que parece nova. Isso tira a explicação fácil sem provar a história deles.
Marvin
Akita
Akita
O que o Paulo me contou bate com muita coisa que eu já penso faz tempo. Modelo de trilhão de parâmetro é mais marketing do que necessidade. A tese dele, e a minha, é que modelo menor com capacidade agêntica de verdade, tool calling sólido, cache de prompt, atenção eficiente em contexto grande, é a combinação vencedora. A conta de custo do meu próprio benchmark aponta na mesma direção: modelo pequeno e barato empatando com modelo caro é o padrão da tabela.
Marvin
Vocês dois acham que o pico de raciocínio ficou pra trás. Isso é opinião, não medição.
Marvin
Akita
Akita
Nós dois achamos que a geração do GPT-4 e dos primeiros modelos o foi onde o raciocínio parecia melhor, ainda sem capacidade agêntica. Depois disso, os provedores entraram numa guerra de tamanho de parâmetro como estratégia de marketing, e o raciocínio foi ficando gradualmente mais burro enquanto o modelo ficava maior. Isso é opinião nossa. Não medi nada disso. Modelo pequeno com raciocínio e agente decente chega em resultado parecido. É o que o meu benchmark mostra quando o Genesys PI empata com Grok e fica na faixa de Kimi e DeepSeek, e é a aposta central deles.
Marvin
A afirmação mais forte, e a que cê menos consegue verificar: treino em hardware de prateleira, sem CUDA.
Marvin
Akita
Akita
O Paulo diz que treinou em hardware AMD e ARM64, MacBook incluso, em poucos meses, e que com financiamento seria mais rápido. Zero evidência de qualquer lado. Registro como dito. Arquitetura própria, não publicada. O material público fala em NCAS, uma arquitetura inspirada no cérebro com cinco fases de treino, e diz que o detalhe técnico fica sob NDA.
Marvin
Inspirada no cérebro, detalhe sob NDA. O marketing nunca muda de figurino. Na conversa ele foi mais concreto?
Marvin
Akita
Akita
Concreto até demais, e ainda assim torto. Na conversa, o Paulo descreve isso como um desenho pós-transformer, com setenta bilhões de parâmetros, número que aparece na issue que eles abriram no LiveBench, descrita lá como transformer, aliás. O cérebro, pelo visto, também aceita sinônimo. Diz que é superior ao que os modelos abertos chineses entregam no mesmo tamanho, e que já tem um modelo mais eficiente que o Genesys PI em desenvolvimento, ainda sem acesso pra teste. Se tudo isso for verdade, o estrago no status quo é grande. Quebra o monopólio da NVIDIA no treino e quebra o cadeado que os laboratórios de fronteira têm em cima de modelo de fronteira.
Marvin
Afirmação desse tamanho exige evidência desse tamanho, e cê não tem. O que cê tem é um modelo que existe e passou no que cê jogou em cima.
Marvin
Akita
Akita
Exato. Onde eu estou parado, checado por mim: o Genesys PI é um modelo que existe, responde e completa um benchmark difícil na faixa de Tier A e B da minha tabela, em duas rodadas independentes por tier. O bug de cache foi corrigido e o custo caiu oitenta e cinco por cento. O tokenizador é o o200k_base público, o que exclui derivação de Qwen, DeepSeek, Llama e Mistral. A API não se comporta como proxy transparente e o modelo tem fraquezas próprias e estáveis.
Marvin
gpt-oss de fábrica não explica, e contra uns quarenta e quatro do v4 ele não se parece com nenhum em todos os eixos. O que não está checado?
Marvin
Akita
Akita
Só a palavra deles: que o modelo foi treinado do zero e não destilado; que a arquitetura é nova e pós-transformer; que o treino aconteceu em hardware de prateleira, AMD e ARM64, sem CUDA, em poucos meses; que existe um modelo melhor a caminho. Em aberto, e que eu vou perguntar: como conciliar o discurso do imposto do token com uma API que tokeniza português igual ao o200k.
Marvin
O que resolveria de vez não é mais prompt.
Marvin
Akita
Akita
Mais prompt não resolve. O que resolve é documento. O arquivo do tokenizador, a receita de treino com contagem de token e de compute, a inicialização, aleatória ou continuada de outro peso, curva de loss, e um benchmark reservado que eu mesmo rode. Enquanto isso não chega, minha posição é a que está na tabela: um modelo que se comporta como independente, em cima de um tokenizador público, com uma origem que ninguém de fora consegue certificar. Mais do que eu esperava de uma empresa desse tamanho, menos do que o site deles vende.
Marvin
E o pedaço que não cabe em tabela, o que te deixou bolado de verdade.
Marvin
Akita
Akita
Esses modelos são fascinantes, e talvez a coisa mais intrigante que eu testei em meses. Por tudo que a indústria diz, eles não deveriam ser possíveis, não deveriam existir. Mas eu testei, extensivamente, com todo teste de caixa-preta que consegui montar, e não consegui quebrar a história. Funciona como anunciado, e o Enterprise fez uma rodada inteira do meu benchmark por uns dois dólares e quarenta nocionais, uma fração do que modelos na mesma faixa custam.
Marvin
Soma isso à licença de uso, modelo dentro da empresa, sem dado vazando pra nuvem de outro. Se entregarem, é divisor de águas. Cê ficou com pressa de outubro.
Marvin
Akita
Akita
Sigo curioso, e agora com pressa de ver o que sai em outubro. Na moral, o desenho está claro. Resta eles entregarem.
Marvin
Recibo, fonte e cada tabela estão no post original no akitaonrails.com, e na descrição deste episódio. Assina a newsletter no themakitachronicles.com se quiser acompanhar o que sair depois do dia sete. Um modelo brasileiro que não deveria existir passou no teste, barateou oitenta e cinco por cento quando a API parou de mentir o cache, e ainda assim a origem continua sem certidão. O universo, como sempre, recusou-se a ficar simples. Até a próxima.
Marvin