Funcionários da OpenAI publicamente acusam os resultados do teste Referência da Grok3 de serem enganosos

GoldenOctober2024

2025-02-23 02:44:46

Geração do resumo em andamento

Em 23 de fevereiro, um funcionário da OpenAI acusou publicamente a empresa xAI de Elon Musk, dizendo que os resultados do teste Referência do mais recente modelo de IA Grok3 divulgado por ela eram enganosos. Em resposta, o cofundador da xAI, Igor Babushkin, insistiu que a empresa não estava errada. Os gráficos da xAI mostram que duas versões do Grok3 – Grok3 Reasoning Beta e Grok3 mini Reasoning – superaram o modelo atualmente mais forte disponível da OpenAI, o3-mini-high, no AIME 2025. No entanto, os funcionários da OpenAI foram rápidos em apontar na plataforma X que o gráfico da xAI não incluía a pontuação AIME 2025 de o3-mini-high sob condições "cons@64". Babushkin argumenta na plataforma X que a OpenAI publicou gráficos de teste de referência igualmente enganosos no passado. Embora esses gráficos sejam usados para comparar o desempenho de seus próprios modelos.

GROK-6.34%

XAI-5.5%

Ver original

Esta página pode conter conteúdo de terceiros, que é fornecido apenas para fins informativos (não para representações/garantias) e não deve ser considerada como um endosso de suas opiniões pela Gate nem como aconselhamento financeiro ou profissional. Consulte a Isenção de responsabilidade para obter detalhes.

3 Curtidas