#agentes-de-codigo
33 posts
2026 - julho
4 posts2026 - junho
3 posts2026 - maio
5 posts2026 - abril
6 posts- LLM Benchmarks: Vale a Pena ($$) Misturar 2 Modelos? (Planner + Executor)
- Benchmark de LLMs pra Coding (Maio 2026): DeepSeek v4, Kimi v2.6, Grok 4.3, GPT 5.5
- Clean Code pra Agentes de IA
- LLM Benchmarks Parte 2: Vale Combinar Múltiplos Modelos no Mesmo Projeto? Claude + GLM??
- Por que as LLMs não te dão o resultado esperado | Por que eu prefiro Claude Code hoje
- VS Code é o novo Cartão Perfurado
2026 - março
2 posts2026 - fevereiro
1 post2026 - janeiro
6 posts- AI Agents: Qual é o melhor? OpenCode, Crush, Claude Code, GPT Codex, Copilot, Cursor, Windsurf, Antigravity?
- AI Agents: GLM 4.7 Flash é realmente tão bom assim?
- AI Agents: Instalando LSPs pro Crush
- AI Agents: Comparando as principais LLM de 2026 no Desafio de Zig
- AI Agents: Garantindo a Proteção do seu Sistema
- Omarchy 3 - Um dos Melhores Agentes pra Programação: Crush
2025 - maio
2 posts2025 - abril
4 posts2026 - julho
4 postsNovidades no meu AI-MEMORY: cada vez melhor pra usar com suas IAs
ai-memory run mantém a mesma sessão de programação ao alternar entre Claude Code, Codex e outros harnesses, com workstreams pesquisáveis e integração com ai-jail e ai-usagebar.
LLM Benchmark: Kimi K3 chegou no nível do Claude Opus?
Coloquei o Kimi K3 para criar sozinho um chat em Rails 8: fez 89/A, superou o Opus 4.6 e foi uma alternativa mais barata ao Opus 4.8. Ainda ficou atrás dele em arquitetura, hardening e testes.
Como me precaver pros meus agentes não apagarem minhas coisas?
LLMs apagando arquivos de gente famosa viraram manchete essa semana. Em cinco meses de uso pesado, em YOLO mode, nunca aconteceu comigo. Mas eu também não confio: snapshots BTRFS, backups restic, sandbox e disciplina.
LLM Benchmark: Sonnet 5 falha, Gemini Flash surpreende, Sakana Fugu quase chega ao Tier A
No benchmark de coding, Sonnet 5 marcou 58/100 porque chamou uma API inexistente, enquanto Gemini 3.5 Flash fez 93/100. Sakana Fugu Ultra ficou em 79/100, perto do Tier A.
2026 - junho
3 postsai-memory: memória de longo prazo (Karpathy Wiki) e auto-aprendizado (Hermes) pros seus projetos
O ai-memory transforma sessões de agentes em uma wiki Markdown consultável, com hooks, MCP e handoff entre ferramentas. Um loop inspirado no Hermes promove memórias com validação, evidência e revisão opcional.
Controvérsia de IA em contribuições de projetos de código aberto - minha opinião
IA em contribuições open source veio para ficar, mesmo trazendo AI slop, regressões e falsos bugs. A saída prática é automatizar triagem e auditoria, sem tirar do humano a decisão final.
LLM Benchmarks - Atualizando sobre Grok 4.3, MiniMax v3 e Opus 4.8
No benchmark Rails 8, Opus 4.8 mantém a liderança com 95/100, enquanto Grok 4.3 e MiniMax M3 enfim ficam usáveis, mas seguem no Tier B e atrás de GPT e Opus.
2026 - maio
5 postsPrimeiras Impressões usando Oh-My-Pi e OpenCode
Oh-My-Pi é mais flexível para projetos com arquivos e artefatos variados, enquanto OpenCode é mais polido no código comum. O teste mostrou que nenhum harness audita tudo, e Codex segue atrás.
Criei um Sistema de Memória pra Agentes de Código: ai-memory
Após encontrar reindexações, perda de dados e hooks defeituosos no agentmemory, Akita criou o ai-memory em Rust, com Markdown, SQLite/FTS5, captura automática e handoff entre agentes. O projeto ainda é beta.
Memória de Agentes IA: Karpathy LLM Wiki e agentmemory na Prática
Akita compara a compaction de Claude Code, Codex e opencode, explica a LLM Wiki de Karpathy e testa o agentmemory antes de retirar a recomendação por bugs estruturais e apontar o ai-memory.
Terminando Minha Maratona de IA: Sucesso ou Fracasso?
Após mais de 500 horas em 24 repositórios, Akita ranqueia seus experimentos e conclui que Codex e Claude Code sustentam programação diária, mas sem revisão e XP a produtividade vira slop.
LLM Benchmarks: DeepSeek Destravado! Use DeepClaude
Troquei o harness do opencode pelo loop do Claude Code via DeepClaude e o DeepSeek V4 Pro subiu de 69/B para 89/A em 18 minutos e $3,14. O bug de multi-turn no controller continua.
2026 - abril
6 postsLLM Benchmarks: Vale a Pena ($$) Misturar 2 Modelos? (Planner + Executor)
Três rodadas mostram que multi-agente não supera o Opus 4.7 solo no opencode, que fez 97/100 em 18 minutos por cerca de $4. GPT 5.4 xHigh com executor medium economiza, mas perde 3 pontos.
Benchmark de LLMs pra Coding (Maio 2026): DeepSeek v4, Kimi v2.6, Grok 4.3, GPT 5.5
Reauditei 24 LLMs na mesma aplicação Rails com RubyLLM: Opus 4.7 e GPT 5.4 empatam em 97, GPT 5.5 chega a 96, Kimi e Gemini viram Tier A, e DeepSeek V4 Pro só atinge Tier A via DeepClaude.
Clean Code pra Agentes de IA
Clean Code muda de peso quando o leitor primário é um agente: código pequeno, nomes greppáveis, contexto de proveniência, testes headless e regras explícitas reduzem navegação, custo e erros.
LLM Benchmarks Parte 2: Vale Combinar Múltiplos Modelos no Mesmo Projeto? Claude + GLM??
Testei sete combinações em Claude Code, opencode e Codex, mas nenhum sub-agente foi chamado. A variância entre runs e harnesses mantém Opus sozinho como padrão para projetos greenfield.
Por que as LLMs não te dão o resultado esperado | Por que eu prefiro Claude Code hoje
Toda semana alguém me diz 'cancelei o Claude, não performa tanto quanto o GPT'. Eu estou com 500+ horas no Claude Code e no Codex, 400 mil linhas geradas, e os dois entregam. A diferença não é o modelo. É como a pessoa está conversando com ele.
VS Code é o novo Cartão Perfurado
Na era dos agentes de código, digitar tudo manualmente no VS Code virou o equivalente moderno do cartão perfurado. O que não virou legado foi fundamento.
2026 - março
2 postsO código fonte do Claude Code vazou. O que achamos dentro.
Analisei o source map que vazou do Claude Code e encontrei features escondidas, memória em camadas, multiagentes e um DRM baseado em xxHash64. O código também expôs um produto difícil de manter.
ai-jail: Sandbox para Agentes de IA — De Shell Script a Ferramenta Real
Transformei um script Bash de bubblewrap no ai-jail, uma ferramenta Rust com configuração TOML por projeto, lockdown e bootstrap de permissões. Ela cobre Linux e macOS, mas a paridade entre plataformas é aproximada.
2026 - fevereiro
1 postAI Agents: Qual seria a melhor Linguagem de Programação para LLMs?
Claude e GPT imaginaram uma linguagem mais adequada a LLMs, com AST tipada, efeitos e proveniência. A partir da ideia, Claude gerou em Rust o protótipo PACT, ainda não testado.
2026 - janeiro
6 postsAI Agents: Qual é o melhor? OpenCode, Crush, Claude Code, GPT Codex, Copilot, Cursor, Windsurf, Antigravity?
Comparei agentes como Crush, OpenCode, Claude Code e Codex e concluí que os harnesses proprietários ainda influenciam o resultado. Mesmo assim, continuo preferindo o Crush e uso Claude Code pontualmente.
AI Agents: GLM 4.7 Flash é realmente tão bom assim?
Rodei o GLM 4.7 Flash localmente numa RTX 5090 e ele foi o único modelo open source a compilar o desafio de Zig. O comportamento foi bom, mas ampliar o contexto o deixou até 20 vezes mais lento.
AI Agents: Instalando LSPs pro Crush
Documentei meu Crush com Claude, Ollama e LM Studio e criei um script para Arch Linux que usa o Mise para detectar linguagens e instalar automaticamente os LSPs correspondentes.
AI Agents: Comparando as principais LLM de 2026 no Desafio de Zig
Testei LLMs comerciais e open source numa migração difícil de Zig 0.15 com llama.cpp. Só as comerciais concluíram, e Claude Opus venceu por resolver tudo mais rápido e com menos insistência.
AI Agents: Garantindo a Proteção do seu Sistema
Mostro como isolar agentes de programação com Bubblewrap: o jail deixa apenas o projeto gravável, oculta o restante do sistema e monta só os diretórios necessários, reduzindo riscos de comandos destrutivos.
Omarchy 3 - Um dos Melhores Agentes pra Programação: Crush
Usei o Crush com Claude Opus 4.5 num blog Hugo e num chat em Zig com llama.cpp, CUDA e Qwen3. Ele refatorou scripts, atualizou APIs, corrigiu um segmentation fault e entregou um binário funcional por quase US$ 8.
2025 - maio
2 postsRANT - LLMs são LOOT BOXES!
Depois de gastar quase USD 150 em testes, concluí que LLMs ajudam em tarefas pequenas, mas programação real continua parecendo uma loot box cara: mais tokens e agentes não garantem código correto.
Quando LLMs não Funcionam pra Programar? Um caso de uso mais real.
Tentei criar um chat em Zig com llama.cpp, CUDA e Qwen3 usando o Gemini 2.5 Pro. Ele resolveu scripts comuns, mas travou na API C++ e consumiu mais de USD 50 em tentativas.
2025 - abril
4 postsTestando o Recém Lançado LLM Open Source - Qwen3 (com Aider e Ollama)
Testei o Qwen3 com Aider, localmente e via OpenRouter, em refatorações e testes. O 14B foi muito mais rápido e competente que o Qwen2.5, embora o Gemini ainda tenha levado vantagem.
Testando LLMs com Aider na RunPod - qual usar pra código?
Comparei modelos de código com Aider na RTX 4090, A40 e H100. O Qwen2.5-Coder 32B foi lento e frustrante, enquanto o 7B se saiu melhor, mas Claude e Gemini venceram.
Seu Próprio Co-Pilot Gratuito Universal que funciona Local: AIDER-OLLAMA-QWEN
Configurei o Aider com APIs comerciais e Ollama, mostrando watch-files, modo arquiteto e prompts. O fluxo local funciona bem para mudanças pequenas, desde que alguém revise tudo e evite commits automáticos.
Hello World de LLM: criando seu próprio chat de I.A. que roda local
Construí o Tiny Qwen CLI para explicar, na prática, como um LLM tokeniza contexto, gera o próximo token e usa parsers e scripts externos para ler arquivos e buscar páginas, formando agentes.