Modelos e plataformas de IA
O Surgimento das Unidades de Processamento Neural: Aumentando a Inteligência Artificial Gerativa em Dispositivos para Velocidade e Sustentabilidade
A evolução da inteligência artificial gerativa não está apenas redesenhando nossa interação e experiências com dispositivos de computação, mas também redefinindo o núcleo da computação. Um dos principais impulsionadores dessa transformação é a necessidade de operar a inteligência artificial gerativa em dispositivos com recursos computacionais limitados. Este artigo discute os desafios que isso apresenta e como as unidades de processamento neural (NPUs) estão surgindo para resolver esses desafios. Além disso, o artigo apresenta alguns dos últimos processadores NPU que estão liderando o caminho nesse campo.
Desafios da Infraestrutura de Inteligência Artificial Gerativa em Dispositivos
A inteligência artificial gerativa, a força motriz por trás da síntese de imagens, geração de texto e composição de música, exige recursos computacionais substanciais. Conventionalmente, essas demandas têm sido atendidas aproveitando as vastas capacidades das plataformas de nuvem. Embora eficaz, essa abordagem vem com seu próprio conjunto de desafios para a inteligência artificial gerativa em dispositivos, incluindo a dependência de conectividade constante com a internet e infraestrutura centralizada. Essa dependência introduz latência, vulnerabilidades de segurança e aumento do consumo de energia.
A espinha dorsal da infraestrutura de inteligência artificial baseada em nuvem depende em grande parte de unidades centrais de processamento (CPUs) e unidades de processamento gráfico (GPUs) para lidar com as demandas computacionais da inteligência artificial gerativa. No entanto, quando aplicadas à inteligência artificial gerativa em dispositivos, esses processadores encontram obstáculos significativos. As CPUs são projetadas para tarefas de propósito geral e carecem da arquitetura especializada necessária para a execução eficiente e de baixo consumo de energia de cargas de trabalho de inteligência artificial gerativa. Suas capacidades limitadas de processamento paralelo resultam em redução da taxa de transferência, aumento da latência e maior consumo de energia, tornando-as menos ideais para a inteligência artificial em dispositivos. Por outro lado, embora as GPUs possam se destacar no processamento paralelo, elas são projetadas principalmente para tarefas de processamento gráfico. Para realizar tarefas de inteligência artificial gerativa de forma eficaz, as GPUs exigem circuitos integrados especializados, que consomem alta potência e geram calor significativo. Além disso, seu grande tamanho físico cria obstáculos para seu uso em aplicações compactas e em dispositivos.
O Surgimento das Unidades de Processamento Neural (NPUs)
Em resposta aos desafios acima, as unidades de processamento neural (NPUs) estão surgindo como tecnologia transformadora para a implementação da inteligência artificial gerativa em dispositivos. A arquitetura das NPUs é inspirada principalmente na estrutura e função do cérebro humano, particularmente em como os neurônios e sinapses colaboram para processar informações. Nas NPUs, os neurônios artificiais atuam como as unidades básicas, espelhando os neurônios biológicos ao receberem entradas, processá-las e produzir saídas. Esses neurônios estão interconectados por meio de sinapses artificiais, que transmitem sinais entre os neurônios com forças variáveis que se ajustam durante o processo de aprendizado. Isso emula o processo de mudanças de peso sináptico no cérebro. As NPUs são organizadas em camadas; camadas de entrada que recebem dados brutos, camadas ocultas que realizam processamento intermediário e camadas de saída que geram os resultados. Essa estrutura em camadas reflete a capacidade de processamento de informações em múltiplos estágios e paralela do cérebro. Como a inteligência artificial gerativa também é construída usando uma estrutura semelhante de redes neurais artificiais, as NPUs são bem adaptadas para gerenciar cargas de trabalho de inteligência artificial gerativa. Essa alinhamento estrutural reduz a necessidade de circuitos integrados especializados, levando a soluções mais compactas, eficientes em termos de energia, rápidas e sustentáveis.
Abordando Diversas Necessidades Computacionais da Inteligência Artificial Gerativa
A inteligência artificial gerativa abrange uma ampla gama de tarefas, incluindo síntese de imagens, geração de texto e composição de música, cada uma com seu próprio conjunto de requisitos computacionais únicos. Por exemplo, a síntese de imagens depende fortemente de operações matriciais, enquanto a geração de texto envolve processamento sequencial. Para atender eficazmente a essas necessidades computacionais diversificadas, as unidades de processamento neural (NPUs) são frequentemente integradas à tecnologia System-on-Chip (SoC) ao lado das CPUs e GPUs.
Cada um desses processadores oferece forças computacionais distintas. As CPUs são particularmente habilidosas em controle sequencial e imediatez, as GPUs se destacam no processamento paralelo de dados em streaming, e as NPUs são finamente ajustadas para operações de inteligência artificial centrais, lidando com matemática escalar, vetorial e tensorial. Ao aproveitar uma arquitetura de computação heterogênea, as tarefas podem ser atribuídas a processadores com base em suas forças e nas demandas específicas da tarefa em questão.
As NPUs, otimizadas para cargas de trabalho de inteligência artificial, podem eficientemente descarregar tarefas de inteligência artificial gerativa do processador central. Essa descarga não apenas garante operações rápidas e eficientes em termos de energia, mas também acelera as tarefas de inferência de inteligência artificial, permitindo que os modelos de inteligência artificial gerativa executem mais suavemente no dispositivo. Com as NPUs lidando com as tarefas relacionadas à inteligência artificial, as CPUs e GPUs são livres para alocar recursos para outras funções, melhorando assim o desempenho geral da aplicação enquanto mantém a eficiência térmica.
Exemplos do Mundo Real de NPUs
O avanço das NPUs está ganhando impulso. Aqui estão alguns exemplos do mundo real de NPUs:
- Hexagon NPUs da Qualcomm (QCOM ) é projetado especificamente para acelerar tarefas de inferência de inteligência artificial em dispositivos de baixa potência e recursos limitados. É construído para lidar com tarefas de inteligência artificial gerativa, como geração de texto, síntese de imagens e processamento de áudio. O Hexagon NPU é integrado às plataformas Snapdragon da Qualcomm, fornecendo execução eficiente de modelos de rede neural nos dispositivos com produtos de inteligência artificial da Qualcomm.
- Apple’s Neural Engine (AAPL ) é um componente-chave dos chips da série A e da série M, impulsionando várias funcionalidades impulsionadas por inteligência artificial, como Face ID, Siri e realidade aumentada (AR). O Neural Engine acelera tarefas como reconhecimento facial para Face ID seguro, processamento de linguagem natural (NLP) para Siri e acompanhamento de objetos aprimorado e compreensão de cena para aplicações de realidade aumentada. Ele melhora significativamente o desempenho de tarefas relacionadas à inteligência artificial nos dispositivos da Apple, fornecendo uma experiência de usuário suave e eficiente.
- O NPU da Samsung é um processador especializado projetado para computação de inteligência artificial, capaz de lidar com milhares de computações simultaneamente. Integrado aos últimos SoCs Exynos da Samsung, que alimentam muitos smartphones da Samsung, essa tecnologia de NPU permite computações de inteligência artificial gerativa de baixa potência e alta velocidade. A tecnologia de NPU da Samsung também é integrada a TVs de ponta, habilitando inovações de som impulsionadas por inteligência artificial e melhorando a experiência do usuário.
- A Arquitetura Da Vinci da Huawei serve como o núcleo do processador de inteligência artificial Ascend da Huawei, projetado para melhorar o poder de computação de inteligência artificial. A arquitetura aproveita um poderoso motor de computação em cubo 3D, tornando-o poderoso para cargas de trabalho de inteligência artificial.
A Linha de Fundo
A inteligência artificial gerativa está transformando nossa interação com dispositivos e redefinindo a computação. O desafio de executar a inteligência artificial gerativa em dispositivos com recursos computacionais limitados é significativo, e as CPUs e GPUs tradicionais frequentemente não atendem às necessidades. As unidades de processamento neural (NPUs) oferecem uma solução promissora com sua arquitetura especializada projetada para atender às demandas da inteligência artificial gerativa. Ao integrar as NPUs à tecnologia System-on-Chip (SoC) ao lado das CPUs e GPUs, podemos utilizar as forças de cada processador, levando a um desempenho de inteligência artificial mais rápido, eficiente e sustentável nos dispositivos. À medida que as NPUs continuam a evoluir, elas estão prestes a melhorar as capacidades de inteligência artificial em dispositivos, tornando as aplicações mais responsivas e eficientes em termos de energia.












