#llms
53 posts
2026 - julho
5 posts2026 - junho
6 posts- Por que LLMs vão falhar na Sua Empresa?
- ai-memory: memória de longo prazo (Karpathy Wiki) e auto-aprendizado (Hermes) pros seus projetos
- A Controvérsia da LLM Rio 3.5. Plágio?
- LLM Benchmark: Kimi v2.7 code, GLM 5.2, Minimax M3 local
- LLM Benchmark: Fable 5 e a novela da Anthropic
- LLM Benchmarks - Atualizando sobre Grok 4.3, MiniMax v3 e Opus 4.8
2026 - maio
4 posts2026 - abril
7 posts- LLM Benchmarks: Vale a Pena ($$) Misturar 2 Modelos? (Planner + Executor)
- Benchmark de LLMs pra Coding (Maio 2026): DeepSeek v4, Kimi v2.6, Grok 4.3, GPT 5.5
- LLM Benchmarks Parte 2: Vale Combinar Múltiplos Modelos no Mesmo Projeto? Claude + GLM??
- Por que as LLMs não te dão o resultado esperado | Por que eu prefiro Claude Code hoje
- RAG Está Morto? Contexto Longo, Grep e o Fim do Vector DB Obrigatório
- Testando LLMs Open Source e Comerciais - Quem Consegue Bater o Claude Opus?
- Transformando YouTube num App de Karaoke | Frank Karaoke
2026 - março
6 posts- Ensinando a questionar notícias | Frank Investigator
- Reescrevi o OpenClaw em Rust, funcionou? | FrankClaw
- Atacando fraudes via email | Frank FBI
- Meu primeiro fracasso com Vibe Code e como Consertei | Frank Yomik
- Eu Fiz um Sistema de Data Mining pra Minha Namorada Influencer — Dicas e Truques
- Software Nunca Está 'Pronto' — 4 Projetos, a Vida Pós-Deploy, e Por Que One-Shot Prompt É Mito
2026 - fevereiro
7 posts- RANT: o Akita abriu as pernas pra IA??
- Vibe Code: Fiz um Indexador Inteligente de Imagens com IA em 2 dias | Frank Sherlock
- Do Zero à Pós-Produção em 1 Semana - Como usar IA em Projetos de Verdade | Bastidores do The M.Akita Chronicles
- AI Agents: Qual seria a melhor Linguagem de Programação para LLMs?
- RANT: IA acabou com os programadores?
- Vibe Code: Fiz um Editor de Markdown do zero com Claude Code (FrankMD) PARTE 2
- Vibe Code: Fiz um Editor de Markdown do zero com Claude Code (FrankMD) PARTE 1
2026 - janeiro
3 posts2025 - junho
1 post2025 - maio
5 posts- Último Tentativa de Treinar uma LLM com LoRa. Tiro de canhão, mas errando a mosca.
- Ensinando Zig mais recente pra sua LLM - Treinando LoRas (quase)
- RANT - LLMs são LOOT BOXES!
- Quando LLMs não Funcionam pra Programar? Um caso de uso mais real.
- Rant - LLMs vão evoluir pra sempre? Desmistificando LLMs na programação
2025 - abril
6 posts- Dissecando um Modelfile de Ollama - Ajustando Qwen3 pra código
- Testando o Recém Lançado LLM Open Source - Qwen3 (com Aider e Ollama)
- Destruindo a "Personalidade" do ChatGPT 4o
- Testando LLMs com Aider na RunPod - qual usar pra código?
- Seu Próprio Co-Pilot Gratuito Universal que funciona Local: AIDER-OLLAMA-QWEN
- Hello World de LLM: criando seu próprio chat de I.A. que roda local
2023 - junho
1 post2023 - janeiro
1 post2020 - agosto
1 post2026 - julho
5 postsLLM Benchmark: Devo usar o que tem nota maior?
Por que o primeiro lugar num ranking de LLMs não é necessariamente o melhor modelo, por que 90+ é um cluster e como usar benchmarks sem terceirizar sua decisão técnica.
LLM Benchmark: Kimi K3 chegou no nível do Claude Opus?
Coloquei o Kimi K3 para criar sozinho um chat em Rails 8: fez 89/A, superou o Opus 4.6 e foi uma alternativa mais barata ao Opus 4.8. Ainda ficou atrás dele em arquitetura, hardening e testes.
LLM Benchmarks: Grok 4.5 e GPT 5.6 Sol
Grok 4.5 entrou na Tier A com 87, e GPT 5.6 Sol marcou 92. O Sol venceu o GPT 5.5 por 92 a 81 no A/B cego, mas a reauditoria o levou a 85. Com o cache-read corrigido, Opus 4.8 segue o melhor equilíbrio na API.
Frank GO: brincando de GO com IA
Criei o Frank GO como um fork do Sabaki com KataGo, reunindo mais de 4.700 tsumego, partidas históricas e 15 jogos de Hikaru no Go. Overlays tornam território e pontuação visíveis para iniciantes.
LLM Benchmark: Sonnet 5 falha, Gemini Flash surpreende, Sakana Fugu quase chega ao Tier A
No benchmark de coding, Sonnet 5 marcou 58/100 porque chamou uma API inexistente, enquanto Gemini 3.5 Flash fez 93/100. Sakana Fugu Ultra ficou em 79/100, perto do Tier A.
2026 - junho
6 postsPor que LLMs vão falhar na Sua Empresa?
A tese, assumidamente especulativa, é que LLMs amplificam processos onde pessoas terceirizam decisões. A alternativa proposta são ciclos diários de decisão, implementação, teste e revisão próximos do resultado.
ai-memory: memória de longo prazo (Karpathy Wiki) e auto-aprendizado (Hermes) pros seus projetos
O ai-memory transforma sessões de agentes em uma wiki Markdown consultável, com hooks, MCP e handoff entre ferramentas. Um loop inspirado no Hermes promove memórias com validação, evidência e revisão opcional.
A Controvérsia da LLM Rio 3.5. Plágio?
A evidência pública indica que o checkpoint inicial da Rio 3.5 era uma mescla de Nex-N2-Pro e Qwen, sem crédito à Nex. O caso aponta falha de atribuição, não plágio jurídico.
LLM Benchmark: Kimi v2.7 code, GLM 5.2, Minimax M3 local
No benchmark, GLM 5.2 marcou 87 e Kimi K2.7 Code, 86. O MiniMax M3 aberto não cabe em 128 GB, enquanto programação séria ainda pede Opus 4.8 ou GPT 5.5.
LLM Benchmark: Fable 5 e a novela da Anthropic
Fable 5 marcou 94/100, praticamente empatado com o Opus 4.8, mas custa dez vezes mais e redireciona tarefas sensíveis. Como o Mythos não é auditável, fico no 4.8.
LLM Benchmarks - Atualizando sobre Grok 4.3, MiniMax v3 e Opus 4.8
No benchmark Rails 8, Opus 4.8 mantém a liderança com 95/100, enquanto Grok 4.3 e MiniMax M3 enfim ficam usáveis, mas seguem no Tier B e atrás de GPT e Opus.
2026 - maio
4 postsSolução Completa de Mangá: Frank Manga+, Frank Yomik, extensão Prettify-Manga
Frank Manga+ leva o catálogo do MANGA Plus ao desktop, enquanto Prettify melhora a leitura em sites e Kindle e Frank Yomik acrescenta furigana ou tradução em páginas japonesas e coreanas.
Criei um Widget de Waybar pra Omarchy pra Monitorar Uso de Planos de LLM: ai-usagebar
O ai-usagebar, port do claudebar para Rust, reúne Claude, Codex, Z.AI e OpenRouter num widget Waybar ou numa TUI standalone que funciona em qualquer terminal, inclusive via SSH.
Memória de Agentes IA: Karpathy LLM Wiki e agentmemory na Prática
Akita compara a compaction de Claude Code, Codex e opencode, explica a LLM Wiki de Karpathy e testa o agentmemory antes de retirar a recomendação por bugs estruturais e apontar o ai-memory.
LLM Benchmarks: DeepSeek Destravado! Use DeepClaude
Troquei o harness do opencode pelo loop do Claude Code via DeepClaude e o DeepSeek V4 Pro subiu de 69/B para 89/A em 18 minutos e $3,14. O bug de multi-turn no controller continua.
2026 - abril
7 postsLLM Benchmarks: Vale a Pena ($$) Misturar 2 Modelos? (Planner + Executor)
Três rodadas mostram que multi-agente não supera o Opus 4.7 solo no opencode, que fez 97/100 em 18 minutos por cerca de $4. GPT 5.4 xHigh com executor medium economiza, mas perde 3 pontos.
Benchmark de LLMs pra Coding (Maio 2026): DeepSeek v4, Kimi v2.6, Grok 4.3, GPT 5.5
Reauditei 24 LLMs na mesma aplicação Rails com RubyLLM: Opus 4.7 e GPT 5.4 empatam em 97, GPT 5.5 chega a 96, Kimi e Gemini viram Tier A, e DeepSeek V4 Pro só atinge Tier A via DeepClaude.
LLM Benchmarks Parte 2: Vale Combinar Múltiplos Modelos no Mesmo Projeto? Claude + GLM??
Testei sete combinações em Claude Code, opencode e Codex, mas nenhum sub-agente foi chamado. A variância entre runs e harnesses mantém Opus sozinho como padrão para projetos greenfield.
Por que as LLMs não te dão o resultado esperado | Por que eu prefiro Claude Code hoje
Toda semana alguém me diz 'cancelei o Claude, não performa tanto quanto o GPT'. Eu estou com 500+ horas no Claude Code e no Codex, 400 mil linhas geradas, e os dois entregam. A diferença não é o modelo. É como a pessoa está conversando com ele.
RAG Está Morto? Contexto Longo, Grep e o Fim do Vector DB Obrigatório
Os modelos frontier passaram dos 200k pra 1M tokens de contexto. Será que ainda faz sentido montar uma stack inteira com vector DB pra fazer RAG, quando dá pra usar grep e jogar o documento inteiro na janela?
Testando LLMs Open Source e Comerciais - Quem Consegue Bater o Claude Opus?
Este benchmark histórico comparou 33 LLMs num app Rails: Opus, Sonnet e GLM 5 funcionaram, enquanto Qwen 3.6 35B chegou perto na RTX 5090 após uma correção. Os rankings foram depois revisados.
Transformando YouTube num App de Karaoke | Frank Karaoke
Criei um app Android em Flutter que sobrepõe pontuação ao vivo a vídeos de karaokê do YouTube, usando filtro de áudio e YIN em quatro modos. É divertido, mas a avaliação ainda é experimental.
2026 - março
6 postsEnsinando a questionar notícias | Frank Investigator
Criei o Frank Investigator para comparar coberturas, rastrear fontes omitidas e analisar notícias em 15 etapas com três LLMs. O relatório aponta omissões e reenquadramentos, mas não dá veredictos finais.
Reescrevi o OpenClaw em Rust, funcionou? | FrankClaw
Reescrevi o core do OpenClaw em Rust como FrankClaw, com 56.586 linhas, 7 canais e correções para as 7 vulnerabilidades críticas auditadas. Ele lida com conversas simples, mas workflows complexos ainda não foram testados.
Atacando fraudes via email | Frank FBI
Construí o Frank FBI para analisar emails encaminhados em seis camadas, combinando autenticação, reputação, OSINT e três LLMs. O resultado é um relatório de risco self-hosted, com os dados sob seu controle.
Meu primeiro fracasso com Vibe Code e como Consertei | Frank Yomik
Como eu gastei dias construindo um sistema de detecção de balões de mangá com OpenCV, joguei tudo fora e reconstruí em horas com um modelo pré-treinado. Lições sobre vibe coding, fracasso produtivo e saber quando mudar de direção.
Eu Fiz um Sistema de Data Mining pra Minha Namorada Influencer — Dicas e Truques
Em três dias, construí um sistema Rails que coleta dados de redes sociais, eventos e concorrentes e os transforma em consultas num bot Discord. A influencer recebe cinco digests diários em português, baseados em dados reais.
Software Nunca Está 'Pronto' — 4 Projetos, a Vida Pós-Deploy, e Por Que One-Shot Prompt É Mito
Depois de 125 commits pós-publicação em quatro projetos, bugs reais, novas features, releases e contribuições externas reforçaram minha conclusão: one-shot serve para demo. Produção exige iteração, testes, CI e decisões humanas.
2026 - fevereiro
7 postsRANT: o Akita abriu as pernas pra IA??
Uso LLMs para programar desde 2023, mas isso não mudou minha rejeição à AGI com a tecnologia atual nem à substituição total de programadores. Para mim, elas removem tarefas mundanas quando há experiência para revisar, decidir e testar.
Vibe Code: Fiz um Indexador Inteligente de Imagens com IA em 2 dias | Frank Sherlock
Em 48 horas, criei o Frank Sherlock, um catálogo local de imagens com Rust, Tauri, Ollama e OCR, publicado em beta para três sistemas. O benchmark favoreceu o qwen2.5vl:7b.
Do Zero à Pós-Produção em 1 Semana - Como usar IA em Projetos de Verdade | Bastidores do The M.Akita Chronicles
Em oito dias, coloquei newsletter, podcast, blog e bot Discord em produção com 274 commits e 1.323 testes. Comparado ao FrankMD, XP, TDD, CI e refatoração contínua entregaram mais com menos dívida.
AI Agents: Qual seria a melhor Linguagem de Programação para LLMs?
Claude e GPT imaginaram uma linguagem mais adequada a LLMs, com AST tipada, efeitos e proveniência. A partir da ideia, Claude gerou em Rust o protótipo PACT, ainda não testado.
RANT: IA acabou com os programadores?
LLMs já ajudam a substituir trabalho braçal, mas não dispensam programadores experientes: o autor vê limites na arquitetura atual e defende revisão sênior, formação sólida e adaptação.
Vibe Code: Fiz um Editor de Markdown do zero com Claude Code (FrankMD) PARTE 2
Em cerca de 30 horas, transformei um protótipo Rails no FrankMD, com i18n, testes e CodeMirror. O resultado foi 6 a 7 vezes mais rápido, mas exigiu refatoração e supervisão constantes.
Vibe Code: Fiz um Editor de Markdown do zero com Claude Code (FrankMD) PARTE 1
Criei o FrankMD, um editor Markdown self-hosted em Rails 8 para meu workflow de blog, com preview, uploads, Hugo, temas e revisão por IA. Em três dias, chegou perto do ideal para meu uso.
2026 - janeiro
3 postsVibe Code: Qual LLM é a MELHOR?? Vamos falar a REAL
Submeti o mesmo app a análises de Opus, GPT 5.2 Codex, Kimi, Gemini e MiniMax. Cada modelo encontrou problemas diferentes, mas nenhum eliminou a necessidade de revisão humana.
AI Agents: Comparando as principais LLM de 2026 no Desafio de Zig
Testei LLMs comerciais e open source numa migração difícil de Zig 0.15 com llama.cpp. Só as comerciais concluíram, e Claude Opus venceu por resolver tudo mais rápido e com menos insistência.
Omarchy 3 - Um dos Melhores Agentes pra Programação: Crush
Usei o Crush com Claude Opus 4.5 num blog Hugo e num chat em Zig com llama.cpp, CUDA e Qwen3. Ele refatorou scripts, atualizou APIs, corrigiu um segmentation fault e entregou um binário funcional por quase US$ 8.
2025 - junho
1 postAGI ou Skynet não vão chegar tão cedo
Questiono previsões de AGI e alarmismo de CEOs e especialistas. O argumento central é que LLMs, com a arquitetura atual, chegaram a um limite e exigem uma nova descoberta para avançar.
2025 - maio
5 postsÚltimo Tentativa de Treinar uma LLM com LoRa. Tiro de canhão, mas errando a mosca.
Aluguei uma H100 para treinar Qwen3-32B com LoRA, mas o modelo consumiu quase toda a VRAM, ficou lento e, no fim, não conseguiu gerar código utilizável.
Ensinando Zig mais recente pra sua LLM - Treinando LoRas (quase)
Treinei um LoRA para levar Zig 0.14 ao Qwen3-8B. O modelo passou a responder que conhecia a versão nova, mas continuou inventando detalhes e errando código, num semi-sucesso.
RANT - LLMs são LOOT BOXES!
Depois de gastar quase USD 150 em testes, concluí que LLMs ajudam em tarefas pequenas, mas programação real continua parecendo uma loot box cara: mais tokens e agentes não garantem código correto.
Quando LLMs não Funcionam pra Programar? Um caso de uso mais real.
Tentei criar um chat em Zig com llama.cpp, CUDA e Qwen3 usando o Gemini 2.5 Pro. Ele resolveu scripts comuns, mas travou na API C++ e consumiu mais de USD 50 em tentativas.
Rant - LLMs vão evoluir pra sempre? Desmistificando LLMs na programação
Após testar Claude, Gemini, Qwen e outros em refatorações reais, questiono benchmarks, evolução exponencial e Vibe Coding. LLMs ajudam, mas ainda dependem de programadores atentos para revisar e corrigir.
2025 - abril
6 postsDissecando um Modelfile de Ollama - Ajustando Qwen3 pra código
Expliquei como temperature, top_p, top_k, min_p e repeat_penalty mudam a geração de tokens e criei um Modelfile para o Qwen3. Com temperatura baixa, o 14B gerou código rápido e utilizável.
Testando o Recém Lançado LLM Open Source - Qwen3 (com Aider e Ollama)
Testei o Qwen3 com Aider, localmente e via OpenRouter, em refatorações e testes. O 14B foi muito mais rápido e competente que o Qwen2.5, embora o Gemini ainda tenha levado vantagem.
Destruindo a "Personalidade" do ChatGPT 4o
Mostrei como configurar o ChatGPT 4o para abandonar elogios, conversa fiada e trejeitos pseudo-humanos. Com as instruções certas, ele passa a responder de forma curta, direta e sem fingir consciência.
Testando LLMs com Aider na RunPod - qual usar pra código?
Comparei modelos de código com Aider na RTX 4090, A40 e H100. O Qwen2.5-Coder 32B foi lento e frustrante, enquanto o 7B se saiu melhor, mas Claude e Gemini venceram.
Seu Próprio Co-Pilot Gratuito Universal que funciona Local: AIDER-OLLAMA-QWEN
Configurei o Aider com APIs comerciais e Ollama, mostrando watch-files, modo arquiteto e prompts. O fluxo local funciona bem para mudanças pequenas, desde que alguém revise tudo e evite commits automáticos.
Hello World de LLM: criando seu próprio chat de I.A. que roda local
Construí o Tiny Qwen CLI para explicar, na prática, como um LLM tokeniza contexto, gera o próximo token e usa parsers e scripts externos para ler arquivos e buscar páginas, formando agentes.
2023 - junho
1 post[Akitando] #142 - Entendendo COMO ChatGPT Funciona - Rodando sua Própria IA
Rodei um Vicuna 30B localmente e mostro como transformers geram texto por probabilidades, com limites de contexto, custo e escala. Hoje, servem como auxílio, mas não são AGI nem substituem programadores.
2023 - janeiro
1 post[Akitando] #135 - ChatGPT Consegue te Substituir? | Entendendo Jobs Assíncronos
Akita usa uploads de imagens para mostrar por que Promises não substituem jobs assíncronos com Bull ou Kafka. O ChatGPT acelera código simples, mas ainda depende de experiência para funcionar em produção.
2020 - agosto
1 post[Akitando #83] "Akita, quais Cursos você recomenda? E o Low-Code? E o GPT-3?"
Akita responde sobre cursos, low-code e GPT-3 e liga tudo à ansiedade profissional. Ferramentas mudam, mas carreira se sustenta em fundamentos e na capacidade de aprender por conta própria.