prix: $0.08746 -1.7955%
Valeur marchande: $15.02B 0.5403%
Chiffre d’affaires (24h): 976.34M 0%
Dominance: 0.5403%
Price: $0.08746 -1.7955%
Valeur marchande: $15.02B 0.5403%
Chiffre d’affaires (24h): 976.34M 0%
Dominance: 0.5403% 0.5403%
  • prix: $0.08746 -1.7955%
  • Valeur marchande: 15.02B 0.5403%
  • Chiffre d’affaires (24h): 976.34M 0%
  • Dominance: 0.5403% 0.5403%
  • prix: $0.08746 -1.7955%
première page > 视频 > Chaque ligne du fichier de configuration de ce modèle d'IA est un papier

Chaque ligne du fichier de configuration de ce modèle d'IA est un papier

libérer: 2026/08/19 08:00 lire: 0

Auteur original:CloudAICode

Source originale:https://www.youtube.com/embed/KridVjxKMdo

#qwen #deepseek #flashattention Personne ne peut suivre la recherche sur l'IA, et les listes de lecture que les gens vous remettent sont classées en fonction de l'intérêt d'un article plutôt que de ce qu'il vous coûte. Ouvrez plutôt le fichier de configuration d'un modèle ouvert frontière et le classement s'écrit tout seul : chaque ligne qu'il contient est un article que quelqu'un a dû publier en premier, et seuls quelques-uns d'entre eux décident si votre facture de service est payable. Cette vidéo lit un fichier de configuration ligne par ligne et classe les onze articles derrière ce fichier en fonction de ce qu'ils vous achètent réellement. Cela commence par un fichier de 2,4 billions de paramètres dans lequel 512 experts sont assis à côté de 10 experts par jeton, donc 95 milliards de paramètres s'activent et le reste dort, et remonte à la combinaison d'experts peu fermée de Shazeer de 2017 et à son gain de capacité revendiqué par 1000 à 137 milliards de paramètres. Puis FlashAttention, où l'idée était la connaissance des E/S plutôt que de meilleurs calculs : 3x sur GPT-2 dans le premier article, 35 à 75 % d'utilisation sur Hopper dans la version 3, 1 613 téraflops par seconde et 71 % d'un B200 dans la version 4, plus quatre versions en quatre semaines par rapport à un article vieux de quatre ans. Les intégrations rotatives arrivent sous la forme d'un article de blog chinois de Jianlin Su quatre semaines avant RoFormer et apparaissent sous forme de corde thêta de 10 millions dans Qwen, 8 millions dans GLM et 10 000 avec un bloc de mise à l'échelle dans DeepSeek. La lignée du cache s'étend de l'attention multi-requêtes en 2019 à l'attention aux requêtes groupées sur 64 têtes de requête jusqu'à 4 têtes de valeur clé, l'attention paginée et le débit de vLLM 2 à 4x, à l'attention latente de DeepSeek réduisant 93,3 % du cache, un contexte de 1 048 576 jetons calculé à partir de 65 536 par un facteur de 16 et une entrée mise en cache à un trente et unième du prix froid. Les sept autres sont également lus : la chaîne de pensée et l'audit de l'Université du Texas qui a trouvé des gains de 14,2 points sur les tâches symboliques et de 12,3 sur les mathématiques mais très peu ailleurs, ReAct et ses trois modes de défaillance connus, GraphRAG et la méthode moins chère que les mêmes auteurs ont livrée sept mois plus tard, MCP et A2A, CLIP et BLIP, et une douzième entrée sur l'indexation clairsemée apprise cachée dans le fichier sous le nom d'index topk. Le classement est rédigé pour quelqu'un qui paie pour l'inférence, et il vaut moins si vous ne le faites pas. Traitez le modèle comme une marchandise réglée avec votre problème difficile dans l'espace entre les appels et les retournements de commandes, avec ReAct et le travail de récupération en premier et l'efficacité quatre pouvant attendre un mois. Les numéros FlashAttention 4 proviennent également de balises bêta sans encore de version stable. ⏱️ TIMESTAMPS : 00:00 - Ouverture du fichier de configuration 00:21 - 512 experts, 10 éveillés 00:37 - Le document de parcimonie de 2017 01:45 - L'attention flash est consciente des IO 03:22 - Intégrations rotatives à partir d'un article de blog 04:43 - Où va l'argent servi 05:42 - Attention aux requêtes groupées 06:04 - Attention paginée et vLLM 06:31 - L'attention latente est réduite de 93 % 07:26 - Chaîne de pensée, auditée 08:28 - ReAct et la boucle d'agent 09:12 - GraphRAG et sa suite moins chère 10:54 - Le classement, non couvert 12:20 - Article douze et un pari 🔗 Les quatre qui paient un loyer : des réseaux de neurones outrageusement grands (peu mélange fermé d'experts, 2017) https://arxiv.org/abs/1701.06538 FlashAttention (attention exacte consciente des IO) https://arxiv.org/abs/2205.14135 flash-attention (le référentiel que vous épinglez, ne citez pas) https://github.com/Dao-AILab/flash-attention RoFormer (intégration de position rotative) https://arxiv.org/abs/2104.09864 Le blog de Jianlin Su, où le rotatif est apparu pour la première fois https://kexue.fm Fast Transformer Decoding (attention multi-requêtes, 2019) https://arxiv.org/abs/1911.02150 GQA (attention aux requêtes groupées) https://arxiv.org/abs/2305.13245 PagedAttention et vLLM https://arxiv.org/abs/2309.06180 vLLM (le moteur de service) https://github.com/vllm-project/vllm DeepSeek-V2 (attention latente multi-têtes) https://arxiv.org/abs/2405.04434 ⚡ Les sept autres et le douzième : • Invite de chaîne de pensée https://arxiv.org/abs/2201.11903 • To CoT ou not to CoT (la méta-analyse de l'Université du Texas) • ReAct (raison et acte) https://arxiv.org/abs/2210.03629 • GraphRAG (Microsoft Research) https://arxiv.org/abs/2404.16130 • LazyGraphRAG (le suivi le moins cher des mêmes auteurs) • Protocole de contexte de modèle https://modelcontextprotocol.io • Protocole A2A (Linux Foundation) • CLIP (apprentissage de modèles visuels transférables) https://arxiv.org/abs/2103.00020 • BLIP (légende, filtre, bootstrap) https://arxiv.org/abs/2201.12086 #qwen #deepseek #flashattention #mixtureofexperts #kvcache #vllm #aipapers #llm #machinelearning 👇 Abonnez-vous et regardez la suite Abonnez-vous pour une nouvelle analyse approfondie chaque semaine : https://www.youtube.com/@CloudAICode Requêtes des utilisateurs : quels documents se trouvent dans un fichier de configuration llm Le fichier de configuration qwen a expliqué un mélange d'experts a expliqué comment fonctionne l'attention flash qu'est-ce que le cache kv dans llms attention aux requêtes groupées vs attention multi-requêtes corde theta expliqué comment fonctionne l'attention paginée est une chaîne de pensée toujours utile meilleurs articles d'IA à lire

Sujets en vedette

  • Activité des baleines Dogecoin
    Activité des baleines Dogecoin
    Obtenez les dernières informations sur les activités des baleines Dogecoin grâce à notre analyse complète. Découvrez les tendances, les modèles et l'impact de ces baleines sur le marché Dogecoin. Restez informé grâce à notre analyse d’experts et gardez une longueur d’avance dans votre parcours de crypto-monnaie.
  • Extraction de Dogecoins
    Extraction de Dogecoins
    Le minage de Dogecoin est le processus d'ajout de nouveaux blocs de transactions à la blockchain Dogecoin. Les mineurs sont récompensés par un nouveau Dogecoin pour leur travail. Cette rubrique propose des articles liés au minage de Dogecoin, notamment sur la manière d'exploiter du Dogecoin, les meilleurs matériels et logiciels de minage et la rentabilité du minage de Dogecoin.
  • Lancement du vaisseau Spacex
    Lancement du vaisseau Spacex
    Cette rubrique fournit des articles relatifs aux lancements de SpaceX Starship, notamment les dates de lancement, les détails de la mission et l'état du lancement. Restez au courant des derniers lancements de SpaceX Starship avec cette ressource informative et complète.
  • Roi des mèmes : Dogecoin
    Roi des mèmes : Dogecoin
    Cette rubrique propose des articles liés aux mèmes les plus populaires, notamment « Le roi des mèmes : Dogecoin ». Memecoin est devenu un acteur dominant dans l’espace crypto. Ces actifs numériques sont populaires pour diverses raisons. Ils pilotent les aspects les plus innovants de la blockchain.