Nossa Tese de IA Cripto (Parte II): A Computação Descentralizada é Rei
Autor original: Teng Yan, encriptação pesquisador
Original compilation: Deep Tide TechFlow
Bom dia! Finalmente chegou.
O conteúdo de todo o nosso artigo é bastante rico. Para tornar mais fácil para todos entenderem (e evitar limitações de tamanho do provedor de serviços de e-mail), decidi dividi-lo em várias partes e compartilhá-lo gradualmente nos próximos meses. Agora, vamos começar!
Um grande arrependimento que nunca consegui esquecer.
Esta situação tem me atormentado até hoje, porque era uma oportunidade óbvia para qualquer pessoa no mercado 01928374656574839201, mas eu a perdi e não investi um centavo.
Não, isto não é o próximo concorrente da Solana, nem uma mememoeda de um cão com um chapéu engraçado.
É... NVIDIA.
Desempenho do preço das ações da NVDA desde o início do ano. Fonte: Google
Apenas em um ano, a capitalização de mercado da NVIDIA subiu de 1 trilhão de dólares para 3 trilhões de dólares, o preço das ações triplicou, superando até mesmo o Bitcoin no mesmo período.
Claro, parte disso é impulsionado pela onda de IA. Mas o mais importante é que isso tem uma base sólida na realidade. A receita da NVIDIA no ano fiscal de 2024 atingiu 600 bilhões de dólares, um aumento de 126% em relação a 2023. Por trás desse aumento impressionante está a corrida das grandes empresas de tecnologia globais para comprar GPUs e garantir uma posição de liderança na corrida armamentista da inteligência artificial geral (AGI).
Por que perdi?
Nos últimos dois anos, minha atenção tem sido completamente focada no campo de Ativos de criptografia, sem seguir as tendências no campo de AI. Isso foi um grande erro e ainda me arrependo.
Mas desta vez, não vou cometer o mesmo erro.
O Crypto AI de hoje me dá uma sensação de déjà vu.
Estamos à beira de uma explosão de inovação. Tem uma semelhança surpreendente com a corrida do ouro da Califórnia do século XIX - indústrias e cidades surgem da noite para o dia, a infraestrutura se desenvolve rapidamente e os aventureiros ganham muito dinheiro.
Assim como a NVIDIA no início, a Crypto AI será tão óbvia quando olharmos para trás no futuro.
Crypto AI: Oportunidades de investimento ilimitadas
· Muitas pessoas ainda o consideram um "castelo no ar".
· A Crypto AI está atualmente em estágio inicial e pode levar de 1 a 2 anos para atingir o pico de especulação.
· Este setor tem um potencial de subir pelo menos 230 mil milhões de dólares.
Crypto AI é baseado na combinação de inteligência artificial com infraestrutura de encriptação. Isso torna mais provável que ele se desenvolva em uma trajetória ascendente exponencial em relação à IA, em vez de seguir o mercado de encriptação mais amplo. Portanto, para se manter à frente, você precisa acompanhar as últimas pesquisas em IA no Arxiv e interagir com os fundadores que acreditam estar construindo o próximo grande evento.
As quatro principais áreas centrais da Crypto AI
Na segunda parte do meu artigo, vou analisar em detalhes os quatro subcampos mais promissores da Crypto AI:
Descentralização计算:模型训练、推理与 GPU 交易市场
Rede de Dados
AI verificável
Um agente de inteligência artificial em execução na cadeia
Este artigo é o resultado de várias semanas de pesquisa aprofundada e conversas com os fundadores e a equipe do Crypto AI. Não se trata de uma análise detalhada de cada área, mas sim de um roteiro de alto nível destinado a despertar sua curiosidade, ajudá-lo a otimizar sua direção de pesquisa e orientar suas decisões de investimento.
Eu imagino o ecossistema da Descentralização AI como uma estrutura em camadas: começa com a rede Descentralização de computação e dados abertos, que fornece a base para o treinamento dos modelos de Descentralização AI.
Todas as entradas e saídas de inferência são verificadas por criptografia, incentivos econômicos de encriptação e redes de avaliação. Esses resultados verificados fluem para agentes de IA autônomos na cadeia e aplicativos de IA de consumo e corporativos confiáveis para os usuários.
A rede de coordenação conecta todo o ecossistema, permitindo uma comunicação e colaboração perfeitas.
Neste cenário, qualquer equipe de desenvolvimento de IA pode aceder a um ou mais níveis do ecossistema de acordo com as suas necessidades. Seja utilizando cálculos de Descentralização para treinar modelos, ou avaliando redes para garantir resultados de alta qualidade, este ecossistema oferece uma variedade de opções.
Graças à componibilidade da blockchain, acredito que estamos a caminhar para um futuro modular. Cada camada será altamente especializada, o protocolo será otimizado para funções específicas, em vez de adotar uma solução integrada.
Nos últimos anos, cada camada da pilha de tecnologia de IA Descentralização tem visto o surgimento de muitas startups, mostrando um crescimento explosivo à moda do Cambriano. A maioria dessas empresas foi fundada há apenas 1-3 anos, o que indica que ainda estamos nos estágios iniciais dessa indústria.
Na imagem ecológica das startups Crypto AI que já vi, a versão mais abrangente e atualizada é mantida por Casey e sua equipe da topology.vc. Este é um recurso indispensável para qualquer pessoa que queira acompanhar o desenvolvimento deste campo.
Ao explorar a Crypto AI em profundidade, sempre me pergunto: qual é realmente o potencial aqui? Não estou a seguir mercados pequenos, mas sim oportunidades enormes que podem expandir-se para um valor de 100 biliões de dólares.
1. Mercado em Escala
Ao avaliar o tamanho do mercado, pergunto a mim mesmo: este subcampo está criando um novo mercado ou está perturbando um mercado existente?
Tomemos o exemplo da Descentralização, que é um campo tipicamente disruptivo. Podemos estimar o seu potencial com base no mercado atual de computação em nuvem. Atualmente, o mercado de computação em nuvem tem um volume de cerca de 6800 mil milhões de dólares e espera-se que atinja 25 mil milhões de dólares em 2032.
Por outro lado, é mais difícil quantificar um novo mercado como agentes de inteligência artificial. Devido à falta de dados históricos, só podemos fazer estimativas com base no nosso julgamento intuitivo da capacidade de resolver problemas e em suposições razoáveis. No entanto, é importante estar ciente de que, por vezes, um produto que parece ser de um mercado completamente novo pode, na realidade, ser apenas um produto que "procura soluções para problemas".
2. Momento
O timing é fundamental para o sucesso. Embora a tecnologia geralmente melhore e se torne mais acessível com o tempo, a velocidade do progresso varia muito entre diferentes áreas.
Em algum subcampo, a maturidade da tecnologia é como? Já é madura o suficiente para ser aplicada em larga escala? Ou ainda está em estágio de pesquisa e levará alguns anos para ser aplicada na prática? O momento determina se um campo vale a pena seguir imediatamente ou se deve ser observado temporariamente.
Tomando a Criptografia Homomórfica Total (Fully Homomorphic Encryption, FHE) como exemplo: o seu potencial é inegável, mas a sua performance técnica atual ainda é muito lenta para permitir uma aplicação em larga escala. Poderemos precisar de mais alguns anos para ver a sua entrada no mercado mainstream. Portanto, dar prioridade a áreas onde a tecnologia está próxima de uma aplicação em larga escala e concentrar o meu tempo e energia em oportunidades que estão ganhando impulso.
Se esses subdomínios fossem representados em um gráfico de 'tamanho do mercado vs. oportunidade', poderia ser um layout como este. É importante notar que isso é apenas um esboço conceitual e não um guia estrito. Também existe complexidade dentro de cada domínio - por exemplo, em inferência verificável, diferentes abordagens, como zkML e opML, estão em estágios diferentes de maturidade técnica.
No entanto, acredito firmemente que o futuro do AI será de proporções enormes. Mesmo os campos que hoje parecem ser de nicho podem evoluir para se tornarem um mercado importante no futuro.
Ao mesmo tempo, também devemos reconhecer que o progresso tecnológico nem sempre é linear - muitas vezes avança de forma saltitante. Quando surgem avanços tecnológicos, minha perspectiva sobre oportunidades e escala de mercado também se ajusta.
Com base na estrutura acima, a seguir vamos desmontar os vários subcampos da Crypto AI um por um, explorando o potencial de desenvolvimento e as oportunidades de investimento.
· A computação descentralizada é o pilar central de toda a Descentralização de IA.
· O mercado de GPUs, treinamento de descentralização e inferência de descentralização estão intimamente relacionados e se desenvolvem de forma sinérgica.
· O lado da oferta é principalmente composto por GPUs de pequenos e médios centros de dados e de consumidores comuns.
· A demanda atual é relativamente pequena, mas está a subir gradualmente, principalmente incluindo utilizadores sensíveis ao preço, com baixa exigência de latência e algumas pequenas empresas iniciantes em IA.
· O maior desafio que o mercado atual de GPU Web3 enfrenta é como fazer com que essas redes funcionem realmente de forma eficiente.
· Coordenar o uso de GPU na rede de Descentralização requer tecnologia de engenharia avançada e um design de arquitetura de rede robusta.
Atualmente, algumas equipas de Crypto AI estão a construir redes GPU Descentralização para aproveitar os recursos computacionais subutilizados em todo o mundo, a fim de lidar com a situação em que a procura por GPU excede em muito a oferta.
O valor central desses mercados de GPU pode ser resumido em três pontos:
Os custos de cálculo podem ser até 90% menores do que os da AWS. Esses custos baixos vêm de duas fontes: a eliminação do intermediário e a abertura do fornecedor. Esses mercados permitem que os usuários acessem os recursos de computação com os menores custos marginais globais.
Sem necessidade de contrato de longo prazo, sem verificação de identidade (KYC), sem espera por aprovação.
Capacidade de resistência à auditoria
Para resolver o problema do fornecedor de suprimentos do mercado, esses mercados obtêm recursos de computação das seguintes fontes:
· GPU empresarial: como a GPU de alto desempenho A100 e H100, esses dispositivos geralmente vêm de data centers de pequeno e médio porte (onde é difícil encontrar clientes suficientes quando operam de forma independente) ou de BTCMineiros que desejam diversificar suas fontes de receita. Além disso, existem equipes que estão aproveitando projetos de infraestrutura governamentais financiados, os quais constroem um grande número de data centers como parte do desenvolvimento tecnológico. Esses fornecedores geralmente são incentivados a manter as GPUs conectadas à rede para ajudar a compensar o custo de depreciação dos equipamentos.
· GPU para consumidores: Milhões de jogadores e usuários domésticos conectam seus computadores à rede e ganham recompensas em TOKEN.
Atualmente, a demanda pelo cálculo de Descentralização é principalmente composta pelos seguintes tipos de usuários:
1. Para usuários sensíveis ao preço e com baixa exigência de latência: como pesquisadores com orçamento limitado, desenvolvedores independentes de IA, etc. Eles priorizam seguir custos em vez de capacidades de processamento em tempo real. Devido a restrições orçamentárias, muitas vezes têm dificuldade em arcar com os custos elevados dos gigantes tradicionais de serviços em nuvem (como AWS ou Azure). É crucial realizar marketing direcionado a esse grupo.
2. Startups de IA de pequeno porte: Essas empresas precisam de recursos de computação flexíveis e escaláveis, mas não desejam assinar contratos de longo prazo com grandes provedores de serviços em nuvem. Atrair esse grupo requer fortalecer a cooperação comercial, pois eles estão buscando ativamente alternativas além da computação em nuvem tradicional.
3. Empresas Iniciais de Cripto IA: Essas empresas estão desenvolvendo produtos de IA Descentralização, mas dependem dessas redes de Descentralização se não possuírem seus próprios recursos de computação.
4. Jogos na nuvem: Embora não esteja diretamente relacionado à IA, a demanda por recursos de GPU nos jogos na nuvem está aumentando rapidamente.
Uma chave a lembrar é: Os desenvolvedores sempre priorizam o custo e a confiabilidade.
Muitas startups consideram o tamanho da rede de fornecimento de GPUs como um sinal de sucesso, mas na verdade isso é apenas um 'indicador de vaidade'.
O verdadeiro gargalo está no lado da demanda, não no lado da oferta. O indicador chave para medir o sucesso não é quantos GPUs existem na rede, mas sim a taxa de utilização dos GPUs e a quantidade real de GPUs alugadas.
O mecanismo de incentivo do TOKEN é muito eficaz no lado do fornecimento, podendo atrair rapidamente recursos para a rede. No entanto, eles não podem resolver diretamente o problema da escassez de demanda. O verdadeiro desafio está em polir o produto para um estado suficientemente bom para despertar a demanda potencial.
Como disse Haseeb Qureshi (da Dragonfly), este é o ponto crucial.
Atualmente, o maior desafio do mercado distribuído de GPU Web3 é realmente como fazer com que essas redes funcionem de forma eficiente.
Isto não é uma tarefa fácil.
Coordinating GPUs in a distributed network is an extremely complex task that involves multiple technical challenges, such as resource allocation, dynamic workload scaling, nó and GPU load balancing, latência management, data transmission, fault tolerance, and how to handle diverse hardware devices distributed worldwide. These issues stack up to form a significant engineering challenge.
Para resolver esses problemas, é necessário ter uma sólida capacidade técnica de engenharia e uma arquitetura de rede robusta e bem projetada.
Para entender melhor isso, pode-se fazer referência ao sistema Kubernetes do Google. O Kubernetes é amplamente considerado o padrão ouro no campo do orquestramento de contêineres, automatizando tarefas como balanceamento de carga e escalabilidade em ambientes distribuídos, desafios semelhantes aos enfrentados pelas redes de GPU distribuídas. Vale ressaltar que o Kubernetes foi desenvolvido com base na experiência de computação distribuída do Google ao longo de mais de uma década, e mesmo assim levou vários anos de iterações para ser aprimorado.
Atualmente, alguns mercados de computação GPU já em funcionamento podem lidar com cargas de trabalho de pequena escala, mas uma vez que se tenta expandir para uma escala maior, os problemas se tornam evidentes. Isso pode ser devido à existência de falhas fundamentais em sua arquitetura de design.
Questões de Credibilidade: Desafios e Oportunidades
Outro problema importante que a rede de computação Descentralização precisa resolver é como garantir a confiabilidade do Nó, ou seja, como verificar se cada Nó realmente fornece o poder de computação que alega. Atualmente, esse processo de verificação depende principalmente do sistema de reputação da rede, e às vezes os provedores de computação são classificados com base na pontuação de reputação. A tecnologia blockchain tem uma vantagem natural nessa área, pois pode realizar um mecanismo de verificação sem confiança. Algumas startups, como Gensyn e Spheron, estão explorando como resolver esse problema de forma não confiável.
Atualmente, muitas equipes Web3 ainda estão lutando para lidar com esses desafios, o que também significa que as oportunidades neste campo ainda são muito amplas.
Então, o quão grande é o mercado da rede de computação Descentralização?
Atualmente, pode representar apenas uma pequena parte do mercado global de computação em nuvem (com tamanho de cerca de US$ 680 bilhões a US$ 2,5 trilhões). No entanto, sempre que o custo da Descentralização computacional for menor do que o dos provedores de serviços em nuvem tradicionais, certamente haverá demanda, mesmo que exista algum atrito adicional na experiência do usuário.
Na minha opinião, a Descentralização continuará a ter custos baixos no curto e médio prazo. Isso se deve principalmente a dois fatores: o subsídio de TOKEN e o desbloqueio do fornecimento por parte dos usuários não sensíveis ao preço. Por exemplo, se eu puder alugar meu notebook de jogos para ganhar renda extra, ficarei satisfeito, seja ganhando US$20 ou US$50 por mês.
O verdadeiro potencial de subir da Descentralização da rede de computação e a expansão significativa de seu tamanho de mercado dependerão dos seguintes fatores-chave:
2. O surto da demanda de inferência: Com o aumento explosivo da demanda de inferência de IA, os data centers existentes podem não ser capazes de atender a essa demanda. Na verdade, essa tendência já está começando a surgir. Jensen Huang da NVIDIA afirmou que a demanda de inferência aumentará em "bilhões".
Descentralização, computação sem permissão é a camada básica do ecossistema de IA Descentralização e também uma das infraestruturas mais importantes.
Embora a cadeia de fornecimento de hardware, como GPUs, esteja em constante expansão, acredito que ainda estamos no amanhecer da 'era da inteligência humana'. No futuro, a demanda por capacidade de computação será infinita.
Por favor, seguir pode desencadear um ponto de viragem crucial no mercado de GPUs - e esse ponto de viragem pode estar prestes a acontecer.
· O mercado de GPUs é altamente competitivo, enfrentando não apenas a concorrência entre plataformas de descentralização, mas também o surgimento de novas plataformas em nuvem de IA Web2 (como Vast.ai e Lambda).
· Pequenos Nó (por exemplo, 4 GPUs H100) têm uma utilidade limitada e não há grande procura no mercado. No entanto, é praticamente impossível encontrar fornecedores que vendam grandes clusters, uma vez que a procura por eles continua muito elevada.
· Será que os recursos computacionais da descentralização do protocolo serão integrados por um líder dominante ou continuarão a ser dispersos por vários mercados? Eu prefiro a primeira opção e acredito que o resultado final seguirá uma distribuição de lei de potência, pois a integração geralmente melhora a eficiência da infraestrutura. Claro, esse processo levará tempo e, durante esse período, a dispersão e a confusão do mercado continuarão.
Os desenvolvedores preferem se concentrar na construção de aplicativos em vez de lidar com problemas de implantação e configuração. Portanto, o mercado de computação precisa simplificar essas complexidades e minimizar o atrito dos usuários ao obter recursos de computação.
Resumo
Se a lei de escalonamento (Scaling Laws) for válida, então no futuro treinar modelos de IA de ponta em um único centro de dados se tornará fisicamente inviável.
· O treinamento de modelos de IA requer uma grande quantidade de transferência de dados entre GPUs, e a velocidade de interconexão em redes de GPU distribuídas geralmente é o maior obstáculo técnico.
Os pesquisadores estão explorando várias soluções e fizeram alguns avanços revolucionários (como Open DiLoCo e DisTrO). Essas inovações tecnológicas terão um efeito cumulativo e acelerarão o desenvolvimento do treinamento de Descentralização.
· O futuro do treinamento pode se concentrar mais em modelos pequenos e especializados projetados para campos específicos, em vez de modelos de ponta para AGI.
· Com a popularização de modelos como o1 da OpenAI, a demanda por inferência terá um aumento explosivo, o que também criará uma grande oportunidade para as redes de inferência Descentralização.
Imagine: um modelo de IA gigante e revolucionário, não desenvolvido por laboratórios secretos de elite, mas sim criado coletivamente por milhões de pessoas comuns. As GPUs dos jogadores não são mais usadas apenas para renderizar gráficos impressionantes em jogos como Call of Duty, mas sim para apoiar um objetivo maior - um modelo de IA de código aberto e coletivamente possuído, sem nenhum intermediário centralizado.
Num futuro assim, os modelos de IA de escala básica deixam de ser exclusivos de laboratórios de ponta e passam a ser o resultado do envolvimento de todos.
Mas, voltando à realidade, a maioria do treinamento de IA de peso pesado ainda está concentrada em centros de dados centralizados, e essa tendência pode não mudar no futuro próximo.
Empresas como a OpenAI estão constantemente expandindo o tamanho de seus clusters de GPUs. Elon Musk revelou recentemente que a xAI está prestes a concluir um centro de dados com um total de GPUs equivalente a 200.000 H100.
Mas o problema não é apenas a quantidade de GPUs. Em seu artigo PaLM de 2022, o Google propôs um indicador-chave - a taxa de utilização de FLOPS do modelo (Model FLOPS Utilization, MFU), para medir a utilização real da capacidade de cálculo máxima da GPU. Surpreendentemente, essa utilização é geralmente apenas de 35-40%.
Por que é tão baixo? Embora o desempenho da GPU esteja avançando rapidamente com a Lei de Moore, a melhoria de dispositivos de rede, memória e armazenamento está muito atrasada, formando um gargalo significativo. Como resultado, a GPU muitas vezes fica ociosa, aguardando a conclusão da transferência de dados.
Atualmente, a única razão fundamental para o treinamento altamente centralizado de IA é a eficiência.
O treino de modelos de grande escala depende das seguintes tecnologias-chave:
· Paralelismo de Dados: dividir o conjunto de dados em várias GPUs para processamento paralelo, acelerando assim o processo de treino.
· Paralelismo de modelo: Distribuir diferentes partes do modelo em várias GPUs para superar as limitações de memória.
Esses requisitos de tecnologia exigem trocas frequentes de dados entre as GPUs, portanto, a velocidade de interconexão (ou seja, a taxa de transferência de dados na rede) é crucial.
Quando o custo do treinamento de modelos de IA pode chegar a 10 bilhões de dólares, cada melhoria na eficiência é crucial.
Os data centers centralizados, com sua tecnologia de interconexão de alta velocidade, podem realizar transferência rápida de dados entre GPUs, resultando em economia significativa de custos durante o treinamento. Isso é algo que a rede de Descentralização atualmente não consegue competir... pelo menos não agora.
Se você conversar com profissionais da área de IA, muitos dirão que o treinamento descentralizado não é viável.
Na arquitetura de Descentralização, os clusters de GPU não estão localizados no mesmo local físico, o que resulta em uma velocidade de transferência de dados mais lenta entre eles, tornando-se o principal gargalo. O processo de treinamento requer sincronização e troca de dados em cada passo da GPU. Quanto maior a distância, maior a latência. E uma latência mais alta significa que a velocidade de treinamento diminui e os custos aumentam.
Uma tarefa de treinamento que leva apenas alguns dias em um centro de dados centralizado pode levar até duas semanas em um ambiente de Descentralização e custar mais caro. Isso claramente não é viável.
No entanto, esta situação está a mudar.
É encorajador ver que a pesquisa sobre treinamento distribuído está Ascensão rapidamente. Pesquisadores estão explorando essa área de diferentes direções simultaneamente, e a abundância recente de resultados e artigos de pesquisa é uma prova disso. Esses avanços tecnológicos terão um efeito cumulativo e acelerarão o desenvolvimento da Descentralização do treinamento.
Além disso, os testes em ambiente de produção real também são cruciais, pois podem ajudar-nos a ultrapassar as barreiras tecnológicas existentes.
Atualmente, algumas técnicas de treinamento de Descentralização já são capazes de lidar com modelos de pequena escala em ambientes de interconexão de baixa velocidade. Pesquisas de ponta estão se esforçando para estender esses métodos a modelos de maior escala.
· Por exemplo, o artigo Open DiCoLo do Prime Intellect propôs um método prático: dividir a GPU em "ilhas", onde cada ilha realiza 500 cálculos locais antes da sincronização, reduzindo assim a largura de bandaGotaem 1/500. Esta tecnologia foi inicialmente desenvolvida pela Google DeepMind para pesquisas em modelos pequenos e agora foi ampliada com sucesso para treinar um modelo com 10 bilhões de parâmetros e recentemente foi totalmenteCódigo aberto.
O quadro DisTrO da Nous Research é ainda mais avançado, reduzindo as necessidades de comunicação entre GPUs em até 10.000 vezes, enquanto treina com sucesso um modelo com 1,2 bilhões de parâmetros usando tecnologia de otimização.
· Este impulso continua. Nous anunciou recentemente que eles concluíram o pré-treinamento de um modelo com 15 bilhões de parâmetros, cuja curva de perda e velocidade de convergência superam até mesmo o desempenho do treinamento centralizado tradicional.
(Detalhes do tweet)
Além disso, métodos como SWARM Parallelism e DTFMHE também estão explorando como treinar modelos de IA de grande escala em diferentes tipos de dispositivos, mesmo que suas velocidades e condições de conexão sejam diferentes.
Outro desafio é como gerir a diversidade de hardware de GPU, especialmente as GPUs de consumo comuns na rede de Descentralização, que geralmente têm memória limitada. Este problema está a ser gradualmente resolvido através da tecnologia de paralelismo de modelos (distribuindo diferentes camadas do modelo por vários dispositivos).
Atualmente, o tamanho do modelo de métodos de treinamento de Descentralização ainda está muito atrás dos modelos de ponta (segundo relatos, o GPT-4 tem quase 1 trilhão de parâmetros, 100 vezes mais que o modelo de 1 bilhão de parâmetros do Prime Intellect). Para alcançar a verdadeira escala, precisamos fazer grandes avanços na arquitetura do modelo, na infraestrutura da rede e na estratégia de alocação de tarefas.
Mas podemos ousar imaginar: no futuro, o treinamento descentralizado pode reunir mais capacidade de cálculo de GPU do que os maiores centros de dados centralizados.
A Pluralis Research (uma equipa muito digna de seguir no campo da formação em Descentralização) acredita que isso não só é possível, como também é inevitável. Os centros de dados centralizados estão limitados por condições físicas, como espaço e fornecimento de energia, enquanto as redes de Descentralização podem aproveitar os recursos virtualmente ilimitados em todo o mundo.
Até mesmo Jensen Huang da NVIDIA mencionou que o treinamento assíncrono descentralizado pode ser a chave para liberar o potencial de expansão da AI. Além disso, a rede de treinamento distribuído possui maior capacidade de tolerância a falhas.
Portanto, em uma possível futura, o modelo de IA mais poderoso do mundo será treinado de forma Descentralização.
Esta visão é emocionante, mas atualmente ainda estou com uma atitude de reserva. Precisamos de mais evidências convincentes para mostrar que o treino de modelos de escala super grande é viável tecnicamente e economicamente.
Na minha opinião, o melhor cenário de aplicação para o treinamento de Descentralização pode estar em modelos Código aberto menores e especializados, projetados para cenários de aplicação específicos, em vez de competir com modelos de ponta de grande porte com foco em AGI. Algumas arquiteturas, especialmente aquelas que não são baseadas em Transformadores, já provaram ser muito adequadas para ambientes de Descentralização.
Além disso, o mecanismo de incentivo Token será uma parte importante do futuro. Uma vez que a Descentralização do treinamento se torne viável em escala, o Token pode efetivamente incentivar e recompensar os contribuidores, impulsionando assim o desenvolvimento dessas redes.
Apesar do caminho longo, os avanços atuais são encorajadores. A quebra do treinamento de Descentralização não apenas beneficiará a rede de Descentralização, mas também trará novas possibilidades para grandes empresas de tecnologia e laboratórios de IA de ponta...
Atualmente, a maioria dos recursos de computação de IA estão concentrados no treinamento de modelos de grande escala. Há uma corrida armamentista em curso entre os principais laboratórios de IA para desenvolver o modelo básico mais poderoso e, eventualmente, alcançar a AGI.
No entanto, acredito que este investimento concentrado em recursos computacionais para treinamento será gradualmente deslocado para inferência nos próximos anos. À medida que a tecnologia de IA se integra cada vez mais em aplicativos que usamos diariamente - desde cuidados de saúde até a indústria do entretenimento - os recursos computacionais necessários para suportar a inferência se tornarão enormes.
Esta tendência não é infundada. O dimensionamento computacional em tempo de inferência tornou-se um tópico quente no espaço da IA. A OpenAI lançou recentemente uma versão prévia/mini do seu mais recente modelo, o1 (nome de código: Morango), que se distingue pela sua capacidade de "ter tempo para pensar". Especificamente, ele analisa quais etapas precisa tomar para responder a uma pergunta e, em seguida, etapas através dessas etapas.
Este modelo foi projetado para tarefas mais complexas e que exigem planejamento, como resolver jogos de palavras cruzadas e lidar com problemas que requerem raciocínio em Profundidade. Embora gere respostas mais lentamente, os resultados são mais detalhados e bem pensados. No entanto, esse design também traz altos custos de execução, com um custo de raciocínio 25 vezes maior que o do GPT-4.
A partir dessa tendência, pode-se ver que o próximo salto no desempenho da IA não depende apenas do treinamento de modelos maiores, mas também da expansão da capacidade de cálculo na fase de inferência.
Se quiser saber mais, vários estudos já comprovaram:
· Através da amostragem repetida, é possível obter melhorias significativas de desempenho em muitas tarefas de inferência computacional.
· A fase de inferência também segue uma lei de escala exponencial (Scaling Law).
Uma vez que os modelos de IA poderosos são treinados, suas tarefas de inferência (ou seja, a fase de aplicação real) podem ser descarregadas para a rede de computação descentralizada. Isso é muito atraente pelas seguintes razões:
· O requisito de recursos para inferência é muito menor do que o treinamento. Após o treinamento, o modelo pode ser comprimido e otimizado por meio de técnicas como quantização, poda ou destilação. Até mesmo é possível dividir o modelo em paralelo de tensor ou paralelismo de pipeline, a fim de executá-lo em dispositivos de consumo comuns. A inferência não requer o uso de GPUs de alta qualidade.
· Esta tendência já está a dar os primeiros passos. Por exemplo, a Exo Labs já encontrou uma forma de executar o modelo Llama3, com 4500 bilhões de parâmetros, em hardware de consumo como o MacBook e o Mac Mini. Ao distribuir tarefas de inferência por vários dispositivos, mesmo as necessidades computacionais em larga escala podem ser concluídas de forma eficiente e económica.
· Melhor experiência do usuário: ao implantar a capacidade de computação em locais mais próximos do usuário, pode-se reduzir significativamente a latência, o que é crucial para aplicativos em tempo real, como jogos, realidade aumentada (AR) ou carros autônomos - nessas situações, cada milissegundo de latência pode fazer a diferença na experiência de uso.
Podemos comparar a Descentralização com o raciocínio AI com um CDN (rede de distribuição de conteúdo). CDN tradicionais transferem rapidamente o conteúdo do site conectando-se a servidores próximos, enquanto a Descentralização de raciocínio utiliza recursos de computação locais para gerar respostas de AI em velocidade extremamente rápida. Dessa forma, os aplicativos de AI podem se tornar mais eficientes, com respostas mais rápidas e também mais confiáveis.
Esta tendência já está começando a surgir. O mais recente chip M4 Pro da Apple tem um desempenho que já se aproxima do NVIDIA RTX 3070 Ti - que costumava ser um GPU de alto desempenho exclusivo para jogadores hardcore. E agora, o hardware que usamos diariamente está se tornando cada vez mais capaz de lidar com cargas de trabalho de IA complexas.
Para que a rede de raciocínio Descentralização seja verdadeiramente bem-sucedida, é necessário oferecer incentivos econômicos suficientemente atraentes aos participantes. Os Nós de computação na rede precisam ser recompensados de forma justa pela capacidade de computação que contribuem, ao mesmo tempo em que o sistema garante a equidade e eficiência na distribuição de recompensas. Além disso, a diversidade geográfica é crucial. Ela não apenas reduz a latência das tarefas de raciocínio, mas também melhora a capacidade de tolerância a falhas da rede, aumentando assim a estabilidade geral.
Então, qual é a melhor maneira de construir uma rede de Descentralização? A resposta é Ativos de criptografia.
Token é uma ferramenta poderosa que unifica os interesses de todos os participantes, garantindo que todos estejam trabalhando para o mesmo objetivo: expandir a escala da rede e aumentar o valor do Token.
Além disso, o TOKEN também pode acelerar significativamente o crescimento da rede. Eles ajudam a resolver o dilema clássico de muitas redes no início do desenvolvimento, sobre se é a galinha que vem primeiro ou o ovo. Ao recompensar os primeiros adotantes, o TOKEN pode impulsionar a participação de mais pessoas na construção da rede desde o início.
O sucesso do BTC e do Ethereum já provou a eficácia desse mecanismo - eles já reuniram a maior piscina de poder de computação do mundo.
A rede de raciocínio descentralizado será o próximo sucessor. Com a natureza geograficamente diversa, essas redes podem reduzir a latência, aumentar a capacidade de tolerância a falhas e aproximar os serviços de IA dos usuários. E com o mecanismo de incentivo impulsionado pela criptografia, a velocidade e eficiência de expansão da rede descentralizada serão muito superiores às redes tradicionais.
Teng Yan
Nos próximos artigos desta série, vamos explorar em profundidade as redes de dados e examinar como elas podem ajudar a superar as restrições de dados enfrentadas pela IA.
Este artigo destina-se apenas a fins educativos e não constitui qualquer aconselhamento financeiro. Não é um endosso para a compra ou venda de ativos ou para decisões financeiras. Ao fazer escolhas de investimento, certifique-se de investigar por si próprio e ser cauteloso.
Link original
: