{"id":970,"date":"2024-05-17T16:15:19","date_gmt":"2024-05-17T18:15:19","guid":{"rendered":"https:\/\/sites.usp.br\/keml\/?page_id=970"},"modified":"2025-08-31T14:45:31","modified_gmt":"2025-08-31T16:45:31","slug":"avaliacao-de-grandes-modelos-de-linguagem","status":"publish","type":"page","link":"https:\/\/sites.usp.br\/keml\/avaliacao-de-grandes-modelos-de-linguagem\/","title":{"rendered":"Avalia\u00e7\u00e3o de grandes modelos de linguagem"},"content":{"rendered":"<h6 style=\"text-align: right;\"><\/h6>\n<div id=\"attachment_984\" style=\"width: 310px\" class=\"wp-caption alignleft\"><a href=\"https:\/\/sites.usp.br\/keml\/wp-content\/uploads\/sites\/1460\/2024\/05\/LLM-evaluation.jpeg\"><img loading=\"lazy\" decoding=\"async\" aria-describedby=\"caption-attachment-984\" class=\"wp-image-984 size-medium\" src=\"https:\/\/sites.usp.br\/keml\/wp-content\/uploads\/sites\/1460\/2024\/05\/LLM-evaluation-300x300.jpeg\" alt=\"\" width=\"300\" height=\"300\" srcset=\"https:\/\/sites.usp.br\/keml\/wp-content\/uploads\/sites\/1460\/2024\/05\/LLM-evaluation-300x300.jpeg 300w, https:\/\/sites.usp.br\/keml\/wp-content\/uploads\/sites\/1460\/2024\/05\/LLM-evaluation-150x150.jpeg 150w, https:\/\/sites.usp.br\/keml\/wp-content\/uploads\/sites\/1460\/2024\/05\/LLM-evaluation-768x768.jpeg 768w, https:\/\/sites.usp.br\/keml\/wp-content\/uploads\/sites\/1460\/2024\/05\/LLM-evaluation-250x250.jpeg 250w, https:\/\/sites.usp.br\/keml\/wp-content\/uploads\/sites\/1460\/2024\/05\/LLM-evaluation-174x174.jpeg 174w, https:\/\/sites.usp.br\/keml\/wp-content\/uploads\/sites\/1460\/2024\/05\/LLM-evaluation-45x45.jpeg 45w, https:\/\/sites.usp.br\/keml\/wp-content\/uploads\/sites\/1460\/2024\/05\/LLM-evaluation-200x200.jpeg 200w, https:\/\/sites.usp.br\/keml\/wp-content\/uploads\/sites\/1460\/2024\/05\/LLM-evaluation-400x400.jpeg 400w, https:\/\/sites.usp.br\/keml\/wp-content\/uploads\/sites\/1460\/2024\/05\/LLM-evaluation.jpeg 1024w\" sizes=\"auto, (max-width: 300px) 100vw, 300px\" \/><\/a><p id=\"caption-attachment-984\" class=\"wp-caption-text\">Imagem gerada por IA (Copilot)<\/p><\/div>\n<p>A r\u00e1pida evolu\u00e7\u00e3o dos grandes modelos de linguagem e a evidente compet\u00eancia deles como modelos fundacionais e como base para a constru\u00e7\u00e3o de agentes conversacionais de prop\u00f3sito geral agu\u00e7am o desejo de pessoas e organiza\u00e7\u00f5es por us\u00e1-los em uma vasta gama de aplica\u00e7\u00f5es. O uso de modelos de linguagem tem provado ser interessante na resolu\u00e7\u00e3o de diferentes problemas que, por natureza, tem suas solu\u00e7\u00f5es baseadas no processamento de uma l\u00edngua natural.<\/p>\n<p>Contudo, \u00e9 exatamente quando deseja-se colocar o modelo de linguagem como o n\u00facleo de um sistema de informa\u00e7\u00e3o que atender\u00e1 a uma necessidade espec\u00edfica que nos deparamos com uma das maiores dificuldades da \u00e1rea: como atestar a qualidade do modelo. A tarefa de consistentemente avaliar a compet\u00eancia de um modelo de linguagem ainda \u00e9 uma quest\u00e3o em aberto. A complexidade desta tarefa aumenta quando esses modelos s\u00e3o acoplados a recursos externos como rebuscados procedimentos de engenharia de prompt e uso de contextos como suporte para formula\u00e7\u00e3o de respostas.<\/p>\n<p>Essa avalia\u00e7\u00e3o, quando quantitativa, \u00e9 pouco expressiva. Quando a compet\u00eancia do modelo de linguagem \u00e9 reduzida a um pequeno conjunto de n\u00fameros, embora possamos tirar conclus\u00f5es relativas entre diferentes modelos submetidos ao mesmo m\u00e9todo de avalia\u00e7\u00e3o, dificilmente conseguimos compreender em que aspectos um modelo \u00e9 melhor do que outro ou o que \u00e9 preciso melhorar. Por outro lado, quando a avalia\u00e7\u00e3o \u00e9 qualitativa, nos deparamos com problemas de custos, falta de sistematiza\u00e7\u00e3o e reprodutibilidade e dificuldades em minimizar subjetividade. Ainda, no que diz respeito a aspectos n\u00e3o funcionais de um sistema, dentro do contexto de modelos de linguagem, h\u00e1 que se preocupar com quest\u00f5es \u00e9ticas, legais, de seguran\u00e7a da informa\u00e7\u00e3o e de seguran\u00e7a de comportamento do pr\u00f3prio modelo.<\/p>\n<p>Nesse contexto estabelece-se um dos pontos de aten\u00e7\u00e3o do grupo KEML: o estudo de m\u00e9todos para avalia\u00e7\u00e3o de modelos de linguagem. Os esfor\u00e7os do grupo est\u00e3o voltados para duas frentes:<\/p>\n<ul>\n<li>desenvolvimento de um framework de avalia\u00e7\u00e3o, denominado HarpIA, que permite avalia\u00e7\u00f5es quantitativas e qualitativas, baseadas em diferentes estrat\u00e9gias e suportadas por sistemas que permitem sistematiza\u00e7\u00e3o, reprodutibilidade, padroniza\u00e7\u00e3o e transpar\u00eancia de avalia\u00e7\u00e3o.<\/li>\n<li>proposi\u00e7\u00e3o de ambientes de avalia\u00e7\u00e3o de grandes modelos de linguagem, orientados a tarefas e a dom\u00ednio, nos quais seja poss\u00edvel explotar o desempenho dos modelos de forma objetiva e controlada. Nessa linha de atua\u00e7\u00e3o, o grupo oferece os ambientes Cocoruta e Blabinha.<\/li>\n<\/ul>\n<p>Conhe\u00e7a um pouco mais \u2026.<\/p>\n<ul>\n<li>Esp\u00edrito Santo, F. O.; Peres, S. M.; Gramacho G. S.; Brand\u00e3o A. A. F.; Cozman, F. G.\u00a0<strong>Legal Document-Based, Domain-Driven Q&amp;A System: LLMs in Perspective\u00a0<\/strong>. In the International Joint Conference on Neural Networks (IJCNN 2024), Yokohama \u2013 Jap\u00e3o, 2024. p.1-9. ISBN: 978-8-3503-5931-2.<\/li>\n<li>Outras publica\u00e7\u00f5es\u00a0<a href=\"https:\/\/sites.usp.br\/keml\/publicacoes\/\" target=\"_blank\" rel=\"noopener\">aqui<\/a>!<\/li>\n<\/ul>\n<hr \/>\n<h3 style=\"text-align: center;\"><span style=\"color: #008080;\"><strong>Modelos de linguagem para portugu\u00eas<\/strong><\/span><\/h3>\n<p>Uma das tarefas do grupo KEML neste projeto \u00e9 avaliar modelos de linguagem voltados \u00e0 l\u00edngua portuguesa (variedades brasileira e europeia). Mantemos uma <a href=\"https:\/\/sites.usp.br\/keml\/modelos-de-linguagem-para-portugues\/\" target=\"_blank\" rel=\"noopener\">lista<\/a> de modelos otimizados para o portugu\u00eas, com foco em arquiteturas de pelo menos 1 bilh\u00e3o de par\u00e2metros.<\/p>\n<p>Para cada modelo, buscamos registrar as seguintes informa\u00e7\u00f5es:<\/p>\n<ul>\n<li>nome<\/li>\n<li>data de lan\u00e7amento<\/li>\n<li>licen\u00e7a<\/li>\n<li>variante do portugu\u00eas usada<\/li>\n<li>tamanho<\/li>\n<li>modelo de linguagem de base<\/li>\n<li>disponibilidade dos pesos otimizados e link de acesso (quando dispon\u00edvel)<\/li>\n<li>varia\u00e7\u00f5es existentes<\/li>\n<li>dados de treinamento\/<em>fine-tuning <\/em>e link de acesso (quando dispon\u00edvel)<\/li>\n<li>data de corte dos dados usados no treinamento<\/li>\n<li>API associada<\/li>\n<li>sistema de chat online com nome e link de acesso (quando dispon\u00edvel)<\/li>\n<li>equipe respons\u00e1vel pelo desenvolvimento<\/li>\n<\/ul>\n<p>Convidamos a comunidade a acessar a <a href=\"https:\/\/sites.usp.br\/keml\/modelos-de-linguagem-para-portugues\/\" target=\"_blank\" rel=\"noopener\">lista<\/a> e contribuir para sua atualiza\u00e7\u00e3o. Algumas informa\u00e7\u00f5es podem estar incompletas ou indispon\u00edveis, e <strong>colabora\u00e7\u00f5es ser\u00e3o devidamente creditadas<\/strong>.<\/p>\n<p style=\"text-align: center;\">Entre em <a href=\"https:\/\/sites.usp.br\/keml\/contato\/\" target=\"_blank\" rel=\"noopener\">contato<\/a> se voc\u00ea quiser contribuir com a lista!<\/p>\n","protected":false},"excerpt":{"rendered":"<p>A r\u00e1pida evolu\u00e7\u00e3o dos grandes modelos de linguagem e a evidente compet\u00eancia deles como modelos fundacionais e como base para a constru\u00e7\u00e3o de agentes conversacionais de prop\u00f3sito geral agu\u00e7am o desejo de pessoas e organiza\u00e7\u00f5es por us\u00e1-los em uma vasta gama de aplica\u00e7\u00f5es. O uso de modelos de linguagem tem provado ser interessante na resolu\u00e7\u00e3o<a href=\"https:\/\/sites.usp.br\/keml\/avaliacao-de-grandes-modelos-de-linguagem\/\">[&#8230;]<\/a><\/p>\n","protected":false},"author":24022,"featured_media":0,"parent":0,"menu_order":0,"comment_status":"closed","ping_status":"closed","template":"","meta":{"inline_featured_image":false,"_monsterinsights_skip_tracking":false,"_monsterinsights_sitenote_active":false,"_monsterinsights_sitenote_note":"","_monsterinsights_sitenote_category":0,"footnotes":"","_links_to":"","_links_to_target":""},"class_list":["post-970","page","type-page","status-publish","hentry"],"_links":{"self":[{"href":"https:\/\/sites.usp.br\/keml\/wp-json\/wp\/v2\/pages\/970","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/sites.usp.br\/keml\/wp-json\/wp\/v2\/pages"}],"about":[{"href":"https:\/\/sites.usp.br\/keml\/wp-json\/wp\/v2\/types\/page"}],"author":[{"embeddable":true,"href":"https:\/\/sites.usp.br\/keml\/wp-json\/wp\/v2\/users\/24022"}],"replies":[{"embeddable":true,"href":"https:\/\/sites.usp.br\/keml\/wp-json\/wp\/v2\/comments?post=970"}],"version-history":[{"count":3,"href":"https:\/\/sites.usp.br\/keml\/wp-json\/wp\/v2\/pages\/970\/revisions"}],"predecessor-version":[{"id":2355,"href":"https:\/\/sites.usp.br\/keml\/wp-json\/wp\/v2\/pages\/970\/revisions\/2355"}],"wp:attachment":[{"href":"https:\/\/sites.usp.br\/keml\/wp-json\/wp\/v2\/media?parent=970"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}