Os últimos seis meses em LLMs em cinco minutos

Os últimos seis meses em LLMs em cinco minutos


Os últimos seis meses em LLMs em cinco minutos

19 de maio de 2026

Reuni esses slides anotados de minha palestra relâmpago de cinco minutos na PyCon US 2026, usando a iteração mais recente de minha ferramenta de apresentação anotada.

Os últimos seis meses em LLMs em cinco minutos

#

Apresentei esta palestra relâmpago na PyCon US 2026, tentando resumir os últimos seis meses de desenvolvimentos em LLMs em cinco minutos.

O ponto de inflexão de novembro

#

Seis meses é um período de tempo bastante conveniente para cobrir, porque capta o que venho chamando de ponto de inflexão de novembro de 2025. Novembro foi um mês crítico nos LLMs, especialmente para codificação.

O “melhor” modelo trocou de mãos 5 vezes entre Anthropic, OpenAl e Google

#

Por um lado, o modelo supostamente “melhor” (dependendo principalmente das vibrações) mudou de mãos cinco vezes entre os três grandes fornecedores.

Gere um SVG de um pelicano andando de bicicleta

#

Como sempre, estou usando meu teste Gerar um SVG de um pelicano andando de bicicleta para ajudar a ilustrar as diferenças entre os modelos.

Por que esse teste? Porque os pelicanos são difíceis de desenhar, as bicicletas são difíceis de desenhar, os pelicanos não posso andar de bicicleta… e não há chance de qualquer laboratório de IA treinar um modelo para uma tarefa tão ridícula.

Cinco pelicanos, um para cada um dos seguintes modelos. Qualidades variadas!

#

No início de novembro, o “melhor” modelo amplamente reconhecido era o Claude Sonnet 4.5, lançado em 29 de setembro. Isso me atraiu esse pelicano.

Em novembro foi ultrapassado pelo GPT-5.1, depois pelo Gemini 3, depois pelo GPT-5.1 Codex Max, e então a Anthropic recuperou a coroa com Claude Opus 4.5.

Acho que Gemini 3 tirou o melhor pelicano deste grupo, mas pelicanos não são tudo. A maioria dos praticantes concordará que o Opus 4.5 manteve a coroa pelos próximos meses.

Os agentes de codificação ficaram bons

#

Demorou um pouco para isso ficar claro, mas a verdadeira notícia de novembro foi que os agentes de codificação conseguiram bom.

OpenAI e Anthropic passaram a maior parte de 2025 executando Reinforcement Learning from Verifiable Rewards para aumentar a qualidade do código escrito por seus modelos, especialmente quando combinados com seus chicotes de agente Codex e Claude Code.

Em Novembro os resultados deste trabalho tornaram-se evidentes. Os agentes de codificação passaram de trabalhar frequentemente para trabalhar principalmente, cruzando uma barreira de qualidade onde você poderia usá-los como um driver diário para realizar o trabalho real, sem precisar gastar a maior parte do tempo corrigindo seus erros estúpidos.

Captura de tela de "Confirmação inicial" no GitHub para steipete/Warelay, commit f6dd362, steipete de autoria em 24 de novembro de 2025 É uma cópia da licença do MIT

#

Também em novembro, isso aconteceu – o primeiro commit em um repositório obscuro (naquela época) chamado “Warelay” por um cara chamado Pete.

Dezembro/Janeiro (Um pouco de psicose LLM)

#

Durante o período de férias, de dezembro a janeiro, muitos de nós aproveitamos o intervalo para dar uma olhada nesses novos modelos e agentes de codificação e ver o que eles poderiam fazer.

Eles poderiam fazer muito! Alguns de nós ficaram um pouco entusiasmados demais. Tive meu próprio ataque de curta duração de uma forma de psicose LLM quando comecei a desenvolver projetos extremamente ambiciosos para ver até onde poderia levá-los.

playground micro-javascript Execute código JavaScript em um ambiente micro-javascript em área restrita alimentado por Pyodide var numbers = (1, 2, 3, 4, 5, 6, 7, 8, 9, 10); var duplicado = números.map(n => n * 2); console.log(‘Duplicado: "’, duplicado); var pares = números.filter(n => n % 2 === 0); console.log(‘Evens: ‘, pares); var soma = números.reduce((a, b) => a + b, @); console.log(‘Soma:"soma); Saída 27 Duplicada: (2, 4, 6, 8, 10, 12, 14, 16, 18, 20) Evens: (2, 4, 6, 8, 10) Soma: 55 Tempo de execução: 8,00 ms Sobre: ​​micro-javascript é um interpretador Python JavaScript puro com memória e limites de tempo configuráveis. Este playground roda inteiramente em seu navegador usando Pyodide (Python compilado para WebAssembly). Ver no GitHub” style=”max-width: 100%”/></p>
</div>
<div class= JavaScript rodando em Python rodando em Pyodide rodando em WebAssembly rodando em JavaScript

#

Essa demonstração do playground mostra o código JavaScript executado usando minha biblioteca micro-javascript, em Python, rodando dentro do Pyodide, rodando em WebAssembly, rodando em JavaScript, rodando em um navegador!

É muito legal! Mas alguém lá fora precisar uma implementação incompleta de JavaScript com erros, lenta e insegura em Python?

Eles não fizeram isso. Tenho alguns outros projetos daquele período de férias que desde então me aposentei silenciosamente!

Fevereiro de 2026

#

Vamos para fevereiro. Lembra daquele projeto Warelay que teve seu primeiro commit no final de novembro?

Warelay → CLAWDIS → CLAWDBOT → Clawdbot → Moltbot →🦞 OpenClaw

#

Em dezembro e janeiro, ele passou por algumas mudanças de nome… e em fevereiro estava conquistando o mundo com seu nome final, OpenClaw.

A quantidade de atenção que recebeu é surpreendente para um projeto que tinha menos de três meses.

Termo genérico: Garra

#

OpenClaw é um “assistente pessoal de IA”, e na verdade temos um termo genérico para eles, baseado em NanoClaw e ZeroClaw e similares… eles são chamados Garras.

Um aquário para sua garra

#

Os Mac Minis começaram a se esgotar no Vale do Silício, porque as pessoas os compravam para operar seus Claws.

Drew Breunig brincou comigo dizendo que isso ocorre porque eles são os novos animais de estimação digitais e um Mac Mini é o aquário perfeito para o seu Claw.

Doc Ock de Alfred Molina em Homem-Aranha 2, destruindo um trem do metrô de Nova York com suas quatro garras.

#

Minha metáfora favorita para Garras é Doc Ock, de Alfred Molina, no filme Homem-Aranha 2 de 2004. Suas garras eram alimentadas por IA e eram perfeitamente seguras, desde que nada danificasse seu chip inibidor… após o que elas se tornavam más e assumiam o controle.

Gemini 3.1 Pro Uma ilustração muito boa de um pelicano andando de bicicleta.

#

Também em fevereiro: o Gemini 3.1 Pro foi lançado e me desenhou um pelicano muito bom andando de bicicleta. Veja isso! Tem até um peixe na cesta.

Pelicano Gemini 3 Pro contrastado com Gemini 3.1 Pro, como SVGs animados

#

E então Jeff Dean do Google tuitou este vídeo de um pelicano animado andando de bicicleta, além de um sapo em um centavo e uma girafa dirigindo um carro minúsculo e um avestruz em patins e uma tartaruga dando kickflips em um skate e um bassê dirigindo uma limusine.

Então talvez os laboratórios de IA estejam prestando atenção, afinal!

Abril de 2026

#

Muitas coisas aconteceram apenas no mês passado.

Gemma 4 26B-A4B (17,99 GB) Um pelicano bastante decente andando de bicicleta, embora a bicicleta esteja um pouco deformada.

#

O Google lançou a série de modelos Gemma 4, que são os modelos abertos mais capazes que já vi de uma empresa norte-americana.

GLM-5.1 MIT, parâmetro 754B, 1,51 TB!

#

Também no mês passado, o laboratório chinês de IA GLM lançou o GLM-5.1 – um monstro de 1,5 TB de peso aberto! Este é um modelo muito eficaz… se você puder pagar o hardware para executá-lo.

#

GLM-5.1 desenhou para mim este pelicano muito competente em uma bicicleta.

A bicicleta está instável, o pelicano está flutuando.

#

… embora quando tentou animá-lo, a bicicleta ricocheteou no topo e ficou empenada.

Captura de tela de Bluesky Charles @ charles.capps.me Acho que você deveria importuná-lo com outro animal usando outro método de locomoção. Algo me diz que foi treinado para isso. Não consigo definir o que é. /s GAMBÁ DA VIRGÍNIA DO NORTE EM UMA E-SCOOTER!!

#

Charles, da Bluesky, sugeriu que eu tentasse com um gambá da Virgínia do Norte em uma E-scooter

GAMBÁ DA VIRGÍNIA DO NORTE CRUZANDO PELA COMUNIDADE DESDE O Anoitecer E uma ilustração muito legal de um gambá.

#

E fez isso! Já tentei isso em outros modelos e eles nem chegam perto. “Cruzando a comunidade desde o anoitecer” é perfeito. Também é animado.

Qwen3.6-35B-A3B é um arquivo de 20,9 GB que roda no meu laptop. Ele desenhou um pelicano melhor em uma bicicleta do que o Opus 4.7, que bagunçou o quadro da bicicleta.

Pelicano Claude Sonnet 4.5 para comparação.

#

Aqui está aquele pelicano Claude Sonnet 4.5 de setembro para comparação.

Os temas dos últimos 6 meses: Os agentes de codificação foram realmente bons. Os modelos locais superam amplamente as expectativas

#

Então esses foram os dois temas principais dos últimos seis meses. Os agentes de codificação ficaram muito bons… e os modelos disponíveis para laptop, embora muito mais fracos que o Frontier, começaram a superar enormemente as expectativas.



Source link

Postagens Similares

  • నేను నా ఫ్రేమ్‌వర్క్‌ను చంపేశాను 13

    16 ఏప్రిల్ 2026 నేను ఈరోజు నా ఆఫీసులో ఉన్నాను, దూరంగా పని చేస్తున్నాను మరియు నా దగ్గర తరచుగా నా వ్యక్తిగత ల్యాప్‌టాప్, ఫ్రేమ్‌వర్క్ 13 ఉంటుంది కాబట్టి నేను నోట్స్ మరియు ఇమెయిల్‌లను తనిఖీ చేయడం, సంగీతం వినడం మొదలైన వాటిని చేస్తాను. నేను నా డెస్క్‌కి అవతలి వైపు ఏదో పట్టుకోవడానికి చేరుకున్నాను మరియు నా ప్రియమైన ల్యాప్‌టాప్‌లో మొత్తం ఫకింగ్ కప్పు కాఫీని కొట్టగలిగాను. ఇది వెంటనే చనిపోయింది, పరికరంలో నిర్మించిన…

  • Taste of Beauty – 植物ベースの高級ダイニング

    ファウンテン バレーにあるテイスト オブ ビューティーは、新鮮な季節の食材を見て、嗅いで、触れて、味わうことができるアートとなる植物ベースの高級レストランです。 メニューは、私たちが故郷と呼ぶこの地球の息を呑むような美しさを思い出させるようにデザインされています。それぞれの料理は地理的な風景を描写し、世界中の料理の風味をブレンドしています。すべての文化と料理がつながっているのと同じように、私たちは母なる自然に対して同じ責任を共有しています。 レストランでは、5 コースと 8 コースのテイスティング メニューを提供しており、各メニューでビーガンまたはベジタリアンを選択できます。両方を試飲できるように、それぞれ1つずつ注文することにしました。 あなたが私のような筋金入りの肉食家であれば、野菜だけのメニューに何百ドルも費やすという考えはお金の無駄のように思えるかもしれません。ただし、オレンジカウンティで最高の高級レストランの 1 つを試してみるのをやめないでください。どの料理もとても美味しく、プレゼンテーションも素晴らしかったです。 4人分のディナーは628.68ドルでした。レストランでは 18% のサービス料が追加されましたが、これはチップだと思いました。しかし、クレジットカードの領収書にサインしようとすると、さらにチップの欄がありました。レストランが請求書に 18% のチップ/サービス料を追加したことは気にしませんでした。ただし、クレジットカードの領収書にチップの一文を追加するのは少し不快でした。それ以外では、テイスト オブ ビューティーは、植物ベースのダイニングに興味がある人にとってはとても興味深いものです。 Source link

  • Люди ставали нещасливішими, коли жити легше

    Мені здається, я щойно зрозумів, чому справи можуть бути такими поганими в Сполучених Штатах і, можливо, в інших місцях. З 1972 року, незважаючи на те, що реальний дохід на душу населення зріс приблизно втричі, відсоток американців, які назвали себе «дуже щасливими», залишився фактично незмінним і становить близько 33%.Річард Істерлін, «The Easterlin Paradox», IZA Discussion Papers,…

  • İNCELEME: X (Daniel John Pilkington)

    Daniel John Pilkington’ın kitabında Xgenellikle insanlardan ihtiyati bir güvenlik önlemi olarak birbirlerinden uzak durmaları istenen mesafeyi belirtmek için kullanılan, COVID sırasında fotoğraflanan bir dizi “X”i bir araya getiriyor – “burada, 1,5 m aralıklarla durun”. Bu, X’in fiil, isim, sıfat, kısaltma, sembol ve ikon olarak farklı tanımlarını bir araya getiren yan sayfalardaki bir şiirle tezat oluşturuyor….

  • ongeza Whisper kwenye Kitufe chako cha Kitendo cha iOS

    IPhone mpya ziliacha kitufe cha kunyamazisha halisi na kitufe cha vitendo kilichowezeshwa na programu, ambacho huruhusu ubinafsishaji fulani. kiwango cha juu zaidi cha ubinafsishaji ni Njia za mkato. Unukuzi chaguomsingi wa Apple ni mbaya. Nilipata iPhone mpya hivi majuzi na kwa hivyo hii ndiyo nafasi yangu. Ilinichukua muda kujua jinsi ya kutengeneza njia ya mkato…

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *