De acordo com um relatório da Webmaster House em 12 de outubro, a equipe de IA / ML da Apple e a equipe de pesquisa da Universidade de Columbia desenvolveram um modelo multimodal grande "Ferret" que pode encontrar com precisão semáforos em imagens, que funciona melhor do que o GPT-4V e melhora a precisão de modelos grandes em tarefas de "olhar, falar, responder". A principal inovação de Ferret reside na estreita combinação de compreensão espacial de referência e fundamentação, permitindo que o modelo compreenda a semântica de uma determinada região e encontre o alvo correspondente ao mesmo tempo.

Ver original
Esta página pode conter conteúdos de terceiros, que são fornecidos apenas para fins informativos (sem representações/garantias) e não devem ser considerados como uma aprovação dos seus pontos de vista pela Gate, nem como aconselhamento financeiro ou profissional. Consulte a Declaração de exoneração de responsabilidade para obter mais informações.
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Comentar
0/400
Nenhum comentário
  • Pino
Negocie cripto em qualquer lugar e a qualquer hora
qrCode
Digitalizar para transferir a aplicação Gate
Novidades
Português (Portugal)
  • 简体中文
  • English
  • Tiếng Việt
  • 繁體中文
  • Español
  • Русский
  • Français (Afrique)
  • Português (Portugal)
  • Bahasa Indonesia
  • 日本語
  • بالعربية
  • Українська
  • Português (Brasil)