libérer: 2026/08/19 08:00 lire: 0
Auteur original:CloudAICode
Source originale:https://www.youtube.com/embed/KridVjxKMdo
#qwen #deepseek #flashattention Personne ne peut suivre la recherche sur l'IA, et les listes de lecture que les gens vous remettent sont classées en fonction de l'intérêt d'un article plutôt que de ce qu'il vous coûte. Ouvrez plutôt le fichier de configuration d'un modèle ouvert frontière et le classement s'écrit tout seul : chaque ligne qu'il contient est un article que quelqu'un a dû publier en premier, et seuls quelques-uns d'entre eux décident si votre facture de service est payable. Cette vidéo lit un fichier de configuration ligne par ligne et classe les onze articles derrière ce fichier en fonction de ce qu'ils vous achètent réellement. Cela commence par un fichier de 2,4 billions de paramètres dans lequel 512 experts sont assis à côté de 10 experts par jeton, donc 95 milliards de paramètres s'activent et le reste dort, et remonte à la combinaison d'experts peu fermée de Shazeer de 2017 et à son gain de capacité revendiqué par 1000 à 137 milliards de paramètres. Puis FlashAttention, où l'idée était la connaissance des E/S plutôt que de meilleurs calculs : 3x sur GPT-2 dans le premier article, 35 à 75 % d'utilisation sur Hopper dans la version 3, 1 613 téraflops par seconde et 71 % d'un B200 dans la version 4, plus quatre versions en quatre semaines par rapport à un article vieux de quatre ans. Les intégrations rotatives arrivent sous la forme d'un article de blog chinois de Jianlin Su quatre semaines avant RoFormer et apparaissent sous forme de corde thêta de 10 millions dans Qwen, 8 millions dans GLM et 10 000 avec un bloc de mise à l'échelle dans DeepSeek. La lignée du cache s'étend de l'attention multi-requêtes en 2019 à l'attention aux requêtes groupées sur 64 têtes de requête jusqu'à 4 têtes de valeur clé, l'attention paginée et le débit de vLLM 2 à 4x, à l'attention latente de DeepSeek réduisant 93,3 % du cache, un contexte de 1 048 576 jetons calculé à partir de 65 536 par un facteur de 16 et une entrée mise en cache à un trente et unième du prix froid. Les sept autres sont également lus : la chaîne de pensée et l'audit de l'Université du Texas qui a trouvé des gains de 14,2 points sur les tâches symboliques et de 12,3 sur les mathématiques mais très peu ailleurs, ReAct et ses trois modes de défaillance connus, GraphRAG et la méthode moins chère que les mêmes auteurs ont livrée sept mois plus tard, MCP et A2A, CLIP et BLIP, et une douzième entrée sur l'indexation clairsemée apprise cachée dans le fichier sous le nom d'index topk. Le classement est rédigé pour quelqu'un qui paie pour l'inférence, et il vaut moins si vous ne le faites pas. Traitez le modèle comme une marchandise réglée avec votre problème difficile dans l'espace entre les appels et les retournements de commandes, avec ReAct et le travail de récupération en premier et l'efficacité quatre pouvant attendre un mois. Les numéros FlashAttention 4 proviennent également de balises bêta sans encore de version stable. ⏱️ TIMESTAMPS : 00:00 - Ouverture du fichier de configuration 00:21 - 512 experts, 10 éveillés 00:37 - Le document de parcimonie de 2017 01:45 - L'attention flash est consciente des IO 03:22 - Intégrations rotatives à partir d'un article de blog 04:43 - Où va l'argent servi 05:42 - Attention aux requêtes groupées 06:04 - Attention paginée et vLLM 06:31 - L'attention latente est réduite de 93 % 07:26 - Chaîne de pensée, auditée 08:28 - ReAct et la boucle d'agent 09:12 - GraphRAG et sa suite moins chère 10:54 - Le classement, non couvert 12:20 - Article douze et un pari 🔗 Les quatre qui paient un loyer : des réseaux de neurones outrageusement grands (peu mélange fermé d'experts, 2017) https://arxiv.org/abs/1701.06538 FlashAttention (attention exacte consciente des IO) https://arxiv.org/abs/2205.14135 flash-attention (le référentiel que vous épinglez, ne citez pas) https://github.com/Dao-AILab/flash-attention RoFormer (intégration de position rotative) https://arxiv.org/abs/2104.09864 Le blog de Jianlin Su, où le rotatif est apparu pour la première fois https://kexue.fm Fast Transformer Decoding (attention multi-requêtes, 2019) https://arxiv.org/abs/1911.02150 GQA (attention aux requêtes groupées) https://arxiv.org/abs/2305.13245 PagedAttention et vLLM https://arxiv.org/abs/2309.06180 vLLM (le moteur de service) https://github.com/vllm-project/vllm DeepSeek-V2 (attention latente multi-têtes) https://arxiv.org/abs/2405.04434 ⚡ Les sept autres et le douzième : • Invite de chaîne de pensée https://arxiv.org/abs/2201.11903 • To CoT ou not to CoT (la méta-analyse de l'Université du Texas) • ReAct (raison et acte) https://arxiv.org/abs/2210.03629 • GraphRAG (Microsoft Research) https://arxiv.org/abs/2404.16130 • LazyGraphRAG (le suivi le moins cher des mêmes auteurs) • Protocole de contexte de modèle https://modelcontextprotocol.io • Protocole A2A (Linux Foundation) • CLIP (apprentissage de modèles visuels transférables) https://arxiv.org/abs/2103.00020 • BLIP (légende, filtre, bootstrap) https://arxiv.org/abs/2201.12086 #qwen #deepseek #flashattention #mixtureofexperts #kvcache #vllm #aipapers #llm #machinelearning 👇 Abonnez-vous et regardez la suite Abonnez-vous pour une nouvelle analyse approfondie chaque semaine : https://www.youtube.com/@CloudAICode Requêtes des utilisateurs : quels documents se trouvent dans un fichier de configuration llm Le fichier de configuration qwen a expliqué un mélange d'experts a expliqué comment fonctionne l'attention flash qu'est-ce que le cache kv dans llms attention aux requêtes groupées vs attention multi-requêtes corde theta expliqué comment fonctionne l'attention paginée est une chaîne de pensée toujours utile meilleurs articles d'IA à lire
CoinBaron
2026-09-21 04:54
SHIBA INU CRYPTO
2026-09-21 04:54
DADS DEFI SPACE
2026-09-21 04:54
Roz Arai Ch.
2026-09-21 04:54
Levi
2026-09-21 04:54
Chan Wei Khjan
2026-09-21 04:35
ICON TV - Polars
2026-09-21 04:35
Kripto Detayı
2026-09-21 04:35
PI News World
2026-09-21 02:35
Sélectionnez la devise
US Dollar
USD
Chinese Yuan
CNY
Japanese Yen
JPY
South Korean Won
KRW
New Taiwan Dollar
TWD
Canadian Dollar
CAD
Euro
EUR
Pound Sterling
GBP
Danish Krone
DKK
Hong Kong Dollar
HKD
Australian Dollar
AUD
Brazilian Real
BRL
Swiss Franc
CHF
Chilean Peso
CLP
Czech Koruna KČ
CZK
Singapore Dollar
SGD
Indian Rupee
INR
Saudi Riyal
SAR
Vietnamese Dong
VND
Thai Baht
THB
Sélectionnez la devise
US Dollar
USD-$
Chinese Yuan
CNY-¥
Japanese Yen
JPY-¥
South Korean Won
KRW -₩
New Taiwan Dollar
TWD-NT$
Canadian Dollar
CAD-$
Euro
EUR - €
Pound Sterling
GBP-£
Danish Krone
DKK-KR
Hong Kong Dollar
HKD- $
Australian Dollar
AUD-$
Brazilian Real
BRL -R$
Swiss Franc
CHF -FR
Chilean Peso
CLP-$
Czech Koruna KČ
CZK -KČ
Singapore Dollar
SGD-S$
Indian Rupee
INR -₹
Saudi Riyal
SAR -SAR
Vietnamese Dong
VND-₫
Thai Baht
THB -฿