Prévia local · Sem cobranças reais. Modelos externos ainda em validação.
← Todos os modelos

Z AI · Avaliação independente

GLM-5.3

Versão avaliada pela Artificial Analysis: GLM-5.3 (max).

Em validação na Lume
Posição geral AA #19 Lista Current · na data verificada
Intelligence Index v4.3 45 pontos Maior é melhor · não é uma porcentagem

Inclui modelos de todos os criadores, não apenas o catálogo Lume. As posições seguem a ordem publicada pela AA, incluindo variantes de raciocínio.

A versão faz diferença. Estes resultados pertencem somente à versão e ao modo indicados acima. A equivalência com a futura configuração Lume ainda será validada.

Do resultado geral aos detalhes

10 avaliações, diferentes capacidades

Ver modelo na Artificial Analysis ↗ Abre em uma nova aba

Os valores abaixo vêm das avaliações publicadas pela AA. Percentuais, Elo e índices têm escalas diferentes e não devem ser comparados entre si.

Trabalho de conhecimento com agentes

AA-Briefcase

1.504 Elo
Elo · maior é melhor

Tarefas profissionais do mundo real

GDPval-AA v2

1.634 Elo
Elo · maior é melhor

Automação de fluxos de trabalho

AutomationBench-AA

62 %
62% Taxa de acerto · maior é melhor

Programação e uso de terminal por agentes

Terminal-Bench 4.0

42 %
42% Taxa de acerto · maior é melhor

Programação científica

SciCode

59 %
59% Taxa de acerto · maior é melhor

Conhecimento e raciocínio avançado

Humanity's Last Exam

42 %
42% Taxa de acerto · maior é melhor

Raciocínio sobre documentos profissionais

GDP.pdf

11 %
11% Taxa de acerto · maior é melhor

Raciocínio em física

CritPt

19 %
19% Taxa de acerto · maior é melhor

Conhecimento e confiabilidade factual

AA-Omniscience

14 pontos
Escala −100 a 100 · maior é melhor

Raciocínio com contexto longo

AA-LCR v1.1

80 %
80% Taxa de acerto · maior é melhor

Fonte dos valores: Tabela de avaliações da Artificial Analysis ↗ Abre em uma nova aba

Como usar estas avaliações

O índice reúne avaliações de tarefas diferentes. Ele não é uma porcentagem de acertos nem uma garantia de desempenho em português. Considere as avaliações relevantes para seu projeto e faça seus próprios testes.

AA-Omniscience pode ter valores negativos: o índice penaliza respostas incorretas. Um valor ausente aparece como indisponível, nunca como zero. Elo representa uma avaliação relativa e não uma taxa de acerto.

Catálogo proposto · acesso em validação

As avaliações são da Artificial Analysis, não da infraestrutura Lume. Versão, modo de raciocínio e configuração podem mudar os resultados. Nesta prévia, apenas lume-mock-small pode ser chamado; os modelos abaixo ainda não estão habilitados.

Testar a demonstração →

Demonstração local

Disponível para testar agora

Abra o console para consultar a demonstração.

    Esta demonstração usa um Mock local. Os modelos comerciais e as avaliações AA abaixo são independentes deste teste.

    Abrir laboratório
    ← Voltar à comparação