Onde está o guaxinim com o rádio amador? (Imagens ChatGPT 2.0)

Onde está o guaxinim com o rádio amador? (Imagens ChatGPT 2.0)


Onde está o guaxinim com o rádio amador? (Imagens ChatGPT 2.0)

21 de abril de 2026

A OpenAI lançou hoje o ChatGPT Images 2.0, seu mais recente modelo de geração de imagens. Na transmissão ao vivo, Sam Altman disse que o salto de gpt-image-1 para gpt-image-2 foi equivalente a saltar de GPT-3 para GPT-5. Veja como eu coloquei isso à prova.

Meu prompt:

Do a where's Waldo style image but it's where is the raccoon holding a ham radio

gpt-image-1

Primeiro, como linha de base, aqui está o que obtive do antigo gpt-image-1 usando ChatGPT diretamente:

Há muita coisa acontecendo, mas não consegui encontrar um guaxinim.

Não consegui localizar o guaxinim – percebi rapidamente que testar modelos de geração de imagens em imagens no estilo Where’s Waldo (Onde está Wally no Reino Unido) pode ser muito frustrante!

Tentei obter o Claude Opus 4.7 com suas novas entradas de resolução mais alta para resolvê-lo, mas ele estava convencido de que havia um guaxinim que não conseguiu encontrar graças ao cartão de instruções no canto superior esquerdo da imagem:

Sim – há pelo menos um guaxinim na foto, mas está muito bem escondido. Em minha varredura cuidadosa pelas seções ampliadas, honestamente, não consegui localizar definitivamente um guaxinim segurando um rádio amador. (…)

Nano Banana 2 e Pró

Em seguida, experimentei o Nano Banana 2 do Google, via Gemini:

Ilustração no estilo Busy Where's Waldo de um festival de parque com multidões de pessoas, tendas rotuladas "COMIDA E BEBIDA", "FEIRA DE ARTESANATO", "RESERVAR RECANTO", "FESTIVAL DE MÚSICA"e "RÁDIO CLUBE AMADOR - W6HAM" (apresentando um guaxinim de chapéu vermelho na mesa do rádio), além de roda gigante, carrossel, mirante com banda, lago com barcos, fonte, food trucks e tendas de circo listradas

Isso era bem óbvio, o guaxinim está na cabine do “Amateur Radio Club” no centro da imagem!

Cláudio disse:

Honestamente, este aqui não estava realmente se escondendo – ele é a estrela do estande. Parece que o ilustrador ficou com pena de nós depois daquela última cena impossível. O pequeno trocadilho com o indicativo “W6HAM” na placa do estande também é um toque legal.

Também experimentei o Nano Banana Pro no AI Studio e obtive este, de longe, o pior resultado de qualquer modelo. Não tenho certeza do que deu errado aqui!

O guaxinim é maior que todos os outros, bem no meio da imagem, com uma borda branca feia ao redor.

gpt-image-2

Com a linha de base estabelecida, vamos testar o novo modelo.

Usei uma versão atualizada do meu script openai_image.py, que é um wrapper fino em torno da biblioteca cliente OpenAI Python. A biblioteca cliente deles ainda não foi atualizada para incluir gpt-image-2 mas felizmente ele não valida o ID do modelo, então você pode usá-lo de qualquer maneira.

Veja como eu executei isso:

OPENAI_API_KEY="$(llm keys get openai)" \
  uv run https://tools.simonwillison.net/python/openai_image.py \
  -m gpt-image-2 \
  "Do a where's Waldo style image but it's where is the raccoon holding a ham radio"

Aqui está o que recebi de volta. Eu não pensar há um guaxinim ali – não consegui localizar nenhum, nem Claude.

Muitas coisas, uma cabine de rádio amador, muitas pessoas, um lago, mas talvez nenhum guaxinim?

O livro de receitas de geração de imagens OpenAI foi atualizado com notas sobre gpt-image-2incluindo o outputQuality configuração e tamanhos disponíveis.

Eu tentei configurar outputQuality para high e as dimensões a 3840x2160—Acredito que seja o máximo—e consegui isto—um PNG de 17MB que converti para um WEBP de 5MB:

OPENAI_API_KEY="$(llm keys get openai)" \
  uv run 'https://raw.githubusercontent.com/simonw/tools/refs/heads/main/python/openai_image.py' \
  -m gpt-image-2 "Do a where's Waldo style image but it's where is the raccoon holding a ham radio" \
  --quality high --size 3840x2160

Onde está o guaxinim com o rádio amador? (Imagens ChatGPT 2.0)

Isso é muito bom! Há um guaxinim com um rádio amador (canto inferior esquerdo, bastante fácil de localizar).

A imagem usou 13.342 tokens de saída, que custam US$ 30/milhão, totalizando um custo de cerca de 40 centavos.

Conclusões

Acho que este novo modelo de geração de imagens ChatGPT tira a coroa do Gemini, pelo menos por enquanto.

As imagens no estilo Where’s Waldo são uma maneira irritante e um tanto tola de testar esses modelos, mas ajudam a ilustrar o quão bons eles estão se tornando em ilustrações complexas, combinando texto e detalhes.

Atualização: pedir aos modelos que resolvam isso é arriscado

rizaco, do Hacker News, pediu ao ChatGPT para desenhar um círculo vermelho ao redor do guaxinim em uma das imagens em que não consegui encontrar um. Aqui está uma mistura animada do resultado e da imagem original:

O círculo aparece em torno de um guaxinim com um rádio amador que definitivamente não está na imagem original!

Parece que definitivamente não podemos confiar nesses modelos para resolver seus próprios quebra-cabeças de maneira útil!



Source link

Postagens Similares

  • xkcd ਦੇ 15 ਸਾਲ

    ਰੈਂਡਲ ਮੁਨਰੋ ਆਪਣੀ ਤਤਕਾਲੀ ਮੰਗੇਤਰ ਦੇ 2010 ਦੇ ਛਾਤੀ ਦੇ ਕੈਂਸਰ ਦੇ ਨਿਦਾਨ ਦੀ ਵਰ੍ਹੇਗੰਢ ‘ਤੇ ਪ੍ਰਤੀਬਿੰਬਤ ਕਰਦਾ ਹੈ, ਜਿਵੇਂ ਕਿ ਉਸਨੇ ਸਾਲ ਦੋ, ਸੱਤ ਅਤੇ 10 # ਵਿੱਚ ਕੀਤਾ ਸੀ। Source link

  • 個人的なAPIの構築|ダニエル・ミスラー

    の(非常に早い)最初のバージョンを起動するのに超宣伝されています デーモン 今日! 2014年以来、私はすべてがAPIを持っているというこの考えに夢中になっています。私は2016年に私の(ちょっと安っぽいが素晴らしいアイデアを持って)本物のモノのインターネットで最初にそれについて話しました。 したがって、これは最初のビルディングブロックです。すべてのオブジェクトにはデーモンがあります。他のすべてのオブジェクトが理解している世界へのAPIです。コンピューター、システム、または適切なアクセスを持つ人間でさえ、他のオブジェクトのデーモンを見て、それとどのように対話するか、そのステータスが何であるか、何ができるかを正確に知ることができます。 The Real Thingのインターネット、2016年 アイデアは、車やレストランのようなオブジェクトだけでなく、デーモンズ/アピスだけでなく、人々でもあるということでした。 最も重要なことは、人間自身もデーモンを持っていることであり、私たちは他のデーモンでいっぱいの世界を移動することです。 Human Daemonsは、タイプ、感度、アクセス制限などに基づいて区分化された人物に関するすべての情報を保持し、そのデータを使用して、私たちの周りのDaemonsに超個人化された要求を送信します。 The Real Thingのインターネット、2016年 デジタルアシスタントと組み合わせる そして、それは他の主要な概念でクリックしました。つまり、人間としてそれを行う方法がないので、常に「私たちの周りに」常に「私たちの周り」にあるこれらの何千ものAPIを常に処理するAIを搭載したデジタルアシスタント(DA)があります。 私はこの文脈に永遠に夢中になっています。 合成インテリジェンスが近い将来に果たす最も目に見える重要な役割は、人間と世界の間のインターフェースとして機能することです。 明確にするために、私は非常に多くのサイエンスフィクションが基づいているSIの絶えず推奨され、意識的で自己改善されたブランドを意味するものではありません。 私が言及しているSIは、人間のコンテキスト、意図、コマンドを監視し、それらを解釈してから、(人間の)プロのパーソナルアシスタント以上の行動をとることができるコンピューターシステムです。 The Real Thingのインターネット、2016年 したがって、DASはTechを使用して私たちの周りのものと根本的にどのように相互作用するかを根本的に変えるという考えでした。私たちのデバイスを使用してそれを行う代わりに、それはスケーリングしない、私たちのDASは私たちのためにそれをしているでしょう。 テクノロジーと直接対話する代わりに、DAと対話し、DAは必要なデーモンで詳細を解決します。私たちは話します、物事が起こります。私たちはジェスチャーします、物事が起こります。私たちはテキストで、物事が起こります。新しい技術を見つけたり、理解したり、習得したりする必要はありません。それは、サービスとDAが自分自身の間でうまくいくためです。 The Real Thingのインターネット、2016年 実際にはうまくいくと思います したがって、具体的には、私がいつも考えているユースケースは、あなたが独身であるコーヒーショップであり、あなたのDAはあなたが関係を探していることを知っており、あなたが歩いて、それは店のすべてのデーモンを読みます。 あなたはスターバックスで並んで待っています、そして、カイ(あなたのDA)はあなたの周りのすべての公共のデーモン(物)とオーラ(人々)を継続的に読んでいます。彼女は非常に多くのことに合わせているので、カイはあなたの前の女の子を照らします。 7/9お気に入りの読書マッチ 恥ずかしがり屋であるが、関係は愛情深い 犬>猫 😍彼女は大声で噛む人々を殺すことは合法であるべきだと信じています カイは話し始めます 彼女 ダ、タラ、そして今、彼とタラはあなたが部屋の向こうからお互いを見るように、どこを見るべきかをあなたに伝えようとしています。 日常のオブジェクトでさえ、独自のオーラを持っています 私はまだデータコンテンツについて多くのことをしていません。 したがって、デーモンは私の初期バージョンです。これは、人間とAIの両方が使用できる形式で私に関する最新の情報を提供するパブリックエンドポイントです。 建築 CloudFlare MCPのデーモンアーキテクチャ そして、これが相互作用の仕組みの大まかな内訳です​​。 CloudFlareワーカーのデーモンMCPアーキテクチャ(フルサイズのためにクリック) それを使用する方法 デーモンはMCP(モデルコンテキストプロトコル)サーバーとして実行されます https://daemon.danielmiessler.com。これと対話する方法は次のとおりです。 利用可能なツールを取得します まず、使用可能なエンドポイントをご覧ください。 バッシュ curl -X…

  • प्रारंभिक संस्थापक ताल की खोज

    जब से मैंने डेविड सैक्स की ‘द कैडेंस’ पढ़ी है तब से मैं इससे काफी प्रेरित हूं। यह 50-500 व्यक्तियों के स्टार्टअप के लिए एक परिचालन प्रक्रिया और आदर्श टीम संरचना निर्धारित करता है – कार्यों के बीच प्रभावी संचार के साथ त्रैमासिक चक्रों में बिक्री, वित्त, उत्पाद और विपणन को चलाना। उदाहरण के लिए…

  • Інженерія структурованого контексту для файлових агентських систем

    Інженерія структурованого контексту для файлових агентських систем (через) Нова стаття Деймона МакМіллана, присвячена дослідженню складних контекстних завдань LLM, що включають великі схеми SQL (до 10 000 таблиць) у різних моделях і форматах файлів: Використовуючи генерацію SQL як проксі для операцій програмного агента, ми представляємо систематичне дослідження контекстної інженерії для структурованих даних, що включає 9649 експериментів…

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *