A ByteDance e a Universidade de Zhejiang lançaram conjuntamente o Vista-LLaMA, um modelo multimodal de grande linguagem que pode interpretar conteúdo de vídeo

2024-01-09 05:19:41

A Bit ByteDance fez uma parceria com a Universidade de Zhejiang para lançar o Vista-LLaMA, um modelo multimodal de linguagem grande projetado para a compreensão de conteúdo de vídeo e capaz de produzir descrições de vídeo de alta qualidade. Através do inovador processamento visual e verbal de tokens, o Vista-LLaMA resolve o problema das "alucinações" no conteúdo de vídeo.

O Vista-LLaMA se destaca em vários benchmarks de perguntas e respostas de vídeo aberto, especialmente nos testes NExT-QA e MSRVTT-QA. Alcançou uma taxa de precisão de 60,7% no teste NExT-QA de tiro zero e 60,5% no teste MSRVTT-QA, superando todos os métodos SOTA atuais. Estes resultados demonstram a eficiência e precisão do Vista-LLaMA na compreensão de conteúdo de vídeo e geração de descrições.

TOKEN-8.27%

Ver original

Esta página pode conter conteúdo de terceiros, que é fornecido apenas para fins informativos (não para representações/garantias) e não deve ser considerada como um endosso de suas opiniões pela Gate nem como aconselhamento financeiro ou profissional. Consulte a Isenção de responsabilidade para obter detalhes.

1 Curtidas

Recompensa
1
1
Repostar
Compartilhar

Comentário

0/400

TalkingAboutCurrency

· 2024-03-14 21:37

Stud Tudo em 🙌

Ver originalResponder0

Tema
#Gate Releases August Reserves Report
14829 Popularidade
#BTC Hits New ATH
101406 Popularidade
#Show My Alpha Points
128173 Popularidade
#ETH Countdown To A New High
6120 Popularidade
#Circle Launches ARC
3208 Popularidade

Marcar

sitemap