SLMs: quando modelos menores de IA fazem mais sentido para as empresas

Modelos de linguagem grandes, os LLMs, chamaram atenção pela escala e pela capacidade de lidar com tarefas amplas. No entanto, nem sempre eles são a melhor opção para todos os cenários.

Segundo a Splunk, LLMs podem ser caros para operar, lentos para responder e excessivos para tarefas específicas e bem definidas. Nesse contexto, os Small Language Models, ou SLMs, surgem como uma alternativa mais eficiente e gerenciável para cargas de trabalho especializadas.

O que são SLMs?

SLMs são modelos de IA relativamente menores quando comparados aos LLMs. Quando bem aplicados, eles podem oferecer alta precisão, além de reduzir custos operacionais e impacto ambiental.

A principal diferença está no foco. Enquanto LLMs são treinados com grandes volumes de dados e costumam ter uma base de conhecimento mais generalista, os SLMs podem ser orientados a domínios específicos.

Na prática, isso significa que um modelo menor pode ser ajustado para executar tarefas mais especializadas, com uma base de conhecimento mais alinhada ao problema que a organização precisa resolver.

Casos especializados não precisam de conhecimento generalista

Nem todo caso de uso empresarial exige um modelo amplo e generalista.

Em setores altamente regulados, como saúde, jurídico e finanças, muitas tarefas dependem de dados especializados, proprietários ou sensíveis. Porém, esses dados nem sempre estão amplamente disponíveis para treinar grandes modelos, seja por questões de privacidade, segurança, limitação de geração de dados ou natureza proprietária.

Por isso, a Splunk aponta que modelos menores, construídos com informações específicas de domínio, podem atender melhor a determinadas tarefas. Entre os exemplos citados estão um chatbot pessoal para insights e suporte financeiro ou uma solução de apoio ao diagnóstico para médicos.

Principais características dos SLMs

Os SLMs se diferenciam dos LLMs por alguns atributos importantes.

Tamanho

Um SLM pode ter alguns bilhões de parâmetros. Em comparação, um LLM pode chegar a trilhões de parâmetros.

Ainda assim, essa diferença é relativa. Os LLMs continuam crescendo à medida que o poder computacional se torna mais disponível a menor custo. Ao mesmo tempo, SLMs não são necessariamente projetados para rodar em dispositivos pessoais com GPUs pequenas.

Atualmente, modelos de linguagem com alguns bilhões de parâmetros ainda são considerados SLMs e não costumam ser adequados para dispositivos de IoT de baixo consumo ou edge computing. No entanto, versões leves para smartphones, geralmente com inferência offline e no próprio dispositivo, são possíveis.

Conhecimento

SLMs tendem a demonstrar conhecimento mais especializado e específico de domínio, enquanto LLMs trabalham com uma base mais ampla e generalista.

Isso depende principalmente dos dados usados no treinamento. Diferente de grandes modelos, os SLMs podem ser pré-treinados em conjuntos de dados específicos de domínio e depois ajustados com dados especializados, proprietários ou únicos daquele campo de conhecimento.

Tarefas especializadas

Um SLM pode ser ajustado para realizar tarefas conversacionais específicas.

A Splunk cita como exemplos um agente de suporte à programação para linguagens, bibliotecas e casos de uso específicos, ou um modelo de visão capaz de interagir com radiologistas e extrair conhecimento útil de imagens médicas.

Arquitetura

SLMs podem derivar de arquiteturas semelhantes às dos LLMs. O regime de treinamento e os algoritmos de aprendizagem também podem ser parecidos.

A diferença pode estar no tamanho da rede e na escala dos blocos de arquitetura. Por exemplo, um SLM pode ter um bloco transformer com menos camadas e atenção completa, enquanto um LLM pode usar conexões esparsas em um módulo transformer maior e com comprimento de contexto mais extenso.

Velocidade de inferência e consumo de recursos

LLMs têm arquiteturas maiores e podem exigir mais tempo e recursos computacionais durante a inferência, ou seja, no momento de responder a um prompt.

Em comparação, SLMs tendem a usar menos tempo e menos recursos para responder. A Splunk também observa que LLMs normalmente são otimizados para responder mais rápido, como uma troca em relação à precisão da inferência, e para rodar em sistemas de computação de alto desempenho.

Já os SLMs costumam ser usados em máquinas de IA padrão com GPUs limitadas.

Viés e lacunas de aprendizagem

Tanto SLMs quanto LLMs estão sujeitos a vieses, dependendo dos dados disponíveis para treinamento.

Se os dados estiverem muito concentrados em determinado resultado, atributo, demografia ou região, o modelo pode refletir essa limitação. Em um exemplo de saúde, informações específicas de uma doença para os grupos e regiões mais afetados podem não se aplicar da mesma forma a outras populações.

Por isso, a governança, a ética em IA e a qualidade dos dados continuam sendo pontos importantes em qualquer estratégia de modelos de linguagem.

O futuro da IA pode ser mais específico

A Splunk destaca que os LLMs já demonstraram bom desempenho em tarefas conversacionais generalistas. Ainda assim, a tendência apontada na matéria é que os casos de uso mais relevantes para modelos de linguagem caminhem para aplicações especializadas com SLMs.

Isso ocorre porque muitas necessidades empresariais exigem conjuntos de dados específicos de domínio, conhecimento especializado, arquiteturas adequadas e algoritmos de treinamento desenhados para otimizar tarefas específicas.

Nesse cenário, modelos menores podem funcionar mais como especialistas em determinado assunto do que como sistemas generalistas.

O que isso significa para empresas e profissionais?

A escolha entre LLMs e SLMs não deve ser guiada apenas pelo tamanho do modelo.

Para empresas, a decisão precisa considerar o tipo de tarefa, os dados disponíveis, os requisitos de segurança, o custo operacional, a precisão esperada e a necessidade de especialização.

Para profissionais de tecnologia, esse movimento reforça a importância de entender fundamentos de IA, dados, governança, automação e arquitetura de soluções. Afinal, aplicar IA de forma eficiente exige saber avaliar qual abordagem faz sentido para cada problema.

Na Fast Lane, nós ajudamos profissionais e empresas a desenvolverem as habilidades necessárias para acompanhar esse cenário, com capacitação voltada às principais tecnologias do mercado.

Cisco + Splunk, DevOps

A Fast Lane é uma empresa global premiada, especializada em treinamentos em tecnologia e negócios, além de oferecer serviços de consultoria para transformação digital. Como único parceiro global dos três principais provedores de nuvem — Microsoft, AWS e Google — e parceiro de outros 30 importantes fornecedores de TI, incluindo Cisco, Aruba, VMware, Palo Alto Networks, Red Hat, entre outros, a Fast Lane oferece soluções de qualificação e serviços profissionais que podem ser escalados conforme a necessidade. Mais de 4.000 profissionais experientes da Fast Lane treinam e orientam clientes de organizações de todos os tamanhos em 90 países ao redor do mundo, nas áreas de nuvem, inteligência artificial, cibersegurança, desenvolvimento de software, redes sem fio e mobilidade, ambiente de trabalho moderno, bem como gestão de TI e projetos.

Mais artigos sobre o tema
Fast Lane
Descubra todos os treinamentos e certificações que a Fast Lane oferece.

Calendário de treinamentos Fast Lane

Quer saber quais treinamentos vão acontecer em breve? Consulte nosso calendário e adquira os conhecimentos com nossos experts.