Prévia local · Sem cobranças reais. Modelos externos ainda em validação.
← Todos os modelos

Alibaba · Avaliação independente

Qwen3.8-Max / Max-0902

Versão avaliada pela Artificial Analysis: Qwen3.8 Max (0902).

Em validação na Lume
Posição geral AA #16 Lista Current · na data verificada
Intelligence Index v4.3 45 pontos Maior é melhor · não é uma porcentagem

Inclui modelos de todos os criadores, não apenas o catálogo Lume. As posições seguem a ordem publicada pela AA, incluindo variantes de raciocínio.

A versão faz diferença. Estes resultados pertencem somente à versão e ao modo indicados acima. A equivalência com a futura configuração Lume ainda será validada.

Do resultado geral aos detalhes

10 avaliações, diferentes capacidades

Ver modelo na Artificial Analysis ↗ Abre em uma nova aba

Os valores abaixo vêm das avaliações publicadas pela AA. Percentuais, Elo e índices têm escalas diferentes e não devem ser comparados entre si.

Trabalho de conhecimento com agentes

AA-Briefcase

1.610 Elo
Elo · maior é melhor

Tarefas profissionais do mundo real

GDPval-AA v2

1.664 Elo
Elo · maior é melhor

Automação de fluxos de trabalho

AutomationBench-AA

56 %
56% Taxa de acerto · maior é melhor

Programação e uso de terminal por agentes

Terminal-Bench 4.0

39 %
39% Taxa de acerto · maior é melhor

Programação científica

SciCode

52 %
52% Taxa de acerto · maior é melhor

Conhecimento e raciocínio avançado

Humanity's Last Exam

43 %
43% Taxa de acerto · maior é melhor

Raciocínio sobre documentos profissionais

GDP.pdf

23 %
23% Taxa de acerto · maior é melhor

Raciocínio em física

CritPt

18 %
18% Taxa de acerto · maior é melhor

Conhecimento e confiabilidade factual

AA-Omniscience

12 pontos
Escala −100 a 100 · maior é melhor

Raciocínio com contexto longo

AA-LCR v1.1

80 %
80% Taxa de acerto · maior é melhor

Fonte dos valores: Tabela de avaliações da Artificial Analysis ↗ Abre em uma nova aba

Como usar estas avaliações

O índice reúne avaliações de tarefas diferentes. Ele não é uma porcentagem de acertos nem uma garantia de desempenho em português. Considere as avaliações relevantes para seu projeto e faça seus próprios testes.

AA-Omniscience pode ter valores negativos: o índice penaliza respostas incorretas. Um valor ausente aparece como indisponível, nunca como zero. Elo representa uma avaliação relativa e não uma taxa de acerto.

Catálogo proposto · acesso em validação

As avaliações são da Artificial Analysis, não da infraestrutura Lume. Versão, modo de raciocínio e configuração podem mudar os resultados. Nesta prévia, apenas lume-mock-small pode ser chamado; os modelos abaixo ainda não estão habilitados.

Testar a demonstração →

Demonstração local

Disponível para testar agora

Abra o console para consultar a demonstração.

    Esta demonstração usa um Mock local. Os modelos comerciais e as avaliações AA abaixo são independentes deste teste.

    Abrir laboratório
    ← Voltar à comparação