De acordo com um relatório da Webmaster House em 12 de outubro, a equipe de IA / ML da Apple e a equipe de pesquisa da Universidade de Columbia desenvolveram um modelo multimodal grande "Ferret" que pode encontrar com precisão semáforos em imagens, que funciona melhor do que o GPT-4V e melhora a precisão de modelos grandes em tarefas de "olhar, falar, responder". A principal inovação de Ferret reside na estreita combinação de compreensão espacial de referência e fundamentação, permitindo que o modelo compreenda a semântica de uma determinada região e encontre o alvo correspondente ao mesmo tempo.
Ver original
Esta página pode conter conteúdos de terceiros, que são fornecidos apenas para fins informativos (sem representações/garantias) e não devem ser considerados como uma aprovação dos seus pontos de vista pela Gate, nem como aconselhamento financeiro ou profissional. Consulte a Declaração de exoneração de responsabilidade para obter mais informações.
De acordo com um relatório da Webmaster House em 12 de outubro, a equipe de IA / ML da Apple e a equipe de pesquisa da Universidade de Columbia desenvolveram um modelo multimodal grande "Ferret" que pode encontrar com precisão semáforos em imagens, que funciona melhor do que o GPT-4V e melhora a precisão de modelos grandes em tarefas de "olhar, falar, responder". A principal inovação de Ferret reside na estreita combinação de compreensão espacial de referência e fundamentação, permitindo que o modelo compreenda a semântica de uma determinada região e encontre o alvo correspondente ao mesmo tempo.