发布: 2026/08/19 08:00 阅读: 0
原文作者:CloudAICode
原文来源:https://www.youtube.com/embed/KridVjxKMdo
#qwen #deepseek #flashattention 没有人能跟上人工智能研究的步伐,人们给你的阅读清单是根据论文的有趣程度而不是你的花费来排名的。相反,打开前沿开放模型的配置文件,排名会自动写入:其中的每一行都是某人必须首先发表的论文,只有其中的少数人决定您的服务账单是否需要支付。该视频逐行读取一个配置文件,并根据其实际购买的内容对后面的 11 篇论文进行排名。它从一个 2.4 万亿个参数文件开始,其中每个代币有 512 名专家,旁边有 10 名专家,因此 950 亿个参数打开,其余参数处于睡眠状态,并追溯到 Shazeer 2017 年的稀疏门控专家混合,以及其声称的 1370 亿个参数的 1000 倍容量增益。然后是 FlashAttention,其中的见解是 IO 意识而不是更好的数学:第一篇论文中 GPT-2 的利用率为 3 倍,版本 3 中 Hopper 的利用率为 35% 到 75%,版本 4 中每秒 1,613 teraflops,B200 的利用率为 71%,加上与四年前的论文相比,四个星期内发布了四个版本。旋转嵌入是由Jianlin Su在RoFormer前四个星期发表的一篇中文博客文章,在Qwen中以1000万绳索θ的形式出现,在GLM中以800万绳索θ的形式出现,在DeepSeek中以缩放块形式出现10,000的绳索θ。缓存沿袭从 2019 年的多查询注意力,到 64 个查询头到 4 个键值头的分组查询注意力,分页注意力和 vLLM 的 2 到 4 倍吞吐量,到 DeepSeek 的潜在注意力削减了 93.3% 的缓存,从 65,536 计算出 1,048,576 个令牌上下文,乘以 16 倍,并以冷价格的 31 倍缓存输入。其他七个也被阅读:思想链和德克萨斯大学审计发现符号任务获得了 14.2 分,数学获得了 12.3 分,但在其他地方几乎没有获得什么,ReAct 及其三种已知的故障模式,GraphRAG 和同一作者在七个月后发布的更便宜的方法,MCP 和 A2A,CLIP 和 BLIP,以及隐藏在文件中作为索引 topk 的关于学习稀疏索引的第十二个条目。该排名是为那些为推理付费的人而写的,如果你不这样做,那么它的价值就会降低。将模型视为已解决的商品,在调用和订单翻转之间的空间中解决您的难题,首先进行 ReAct 和检索工作,效率四可以等待一个月。 FlashAttention 4 的数字也来自测试版标签,但尚未发布稳定版本。 ⏱️ TIMESTAMPS:00:00 - 打开配置文件 00:21 - 512 名专家,10 名清醒 00:37 - 2017 年稀疏性论文 01:45 - Flash 注意力是 IO 感知的 03:22 - 来自博客文章的旋转嵌入 04:43 - 服务资金去向 05:42 - 分组查询注意力06:04 - 分页注意力和 vLLM 06:31 - 潜在注意力减少 93% 07:26 - 思想链,经过审核 08:28 - ReAct 和代理循环 09:12 - GraphRAG 及其更便宜的续集 10:54 - 排名,未对冲 12:20 - 第 12 篇论文和一个赌注 🔗 支付租金的四个:惊人的大型神经网络(稀疏门控专家混合体,2017) https://arxiv.org/abs/1701.06538 FlashAttention(IO 感知精确注意力) https://arxiv.org/abs/2205.14135 flash-attention(您固定的存储库,而不是引用) https://github.com/Dao-AILab/flash-attention RoFormer(旋转位置嵌入) https://arxiv.org/abs/2104.09864 苏建林的博客,旋转首先出现 https://kexue.fm Fast Transformer Decoding(多查询注意力,2019) https://arxiv.org/abs/1911.02150 GQA(分组查询注意力) https://arxiv.org/abs/2305.13245 PagedAttention 和 vLLM https://arxiv.org/abs/2309.06180 vLLM(服务引擎) https://github.com/vllm-project/vllm DeepSeek-V2(多头潜在注意力) https://arxiv.org/abs/2405.04434 ⚡ 其他七个,第十二个: • 思想链提示https://arxiv.org/abs/2201.11903 • To CoT or not to CoT(德克萨斯大学荟萃分析) • ReAct(原因与行动) https://arxiv.org/abs/2210.03629 • GraphRAG(微软研究院) https://arxiv.org/abs/2404.16130 • LazyGraphRAG(同一作者的更便宜的后续产品) •模型上下文协议 https://modelcontextprotocol.io • A2A 协议(Linux 基金会) • CLIP(学习可转移视觉模型) https://arxiv.org/abs/2103.00020 • BLIP(标题、过滤器、引导程序) https://arxiv.org/abs/2201.12086 #qwen #deepseek #flashattention #mixtureofexperts #kvcache #vllm #aipapers #llm #machinelearning 👇 订阅并观看下一篇 每周订阅一个新的深入研究:https://www.youtube.com/@CloudAICode 用户查询:llm 配置文件中有哪些论文 qwen 配置文件解释了专家的混合解释了 flash 注意力如何工作 llms 中的 kv 缓存分组查询注意力与多查询注意力绳 theta 解释了分页注意力如何工作是思想链仍然有用最好的人工智能论文阅读
CoinBaron
2026-09-21 04:54
SHIBA INU CRYPTO
2026-09-21 04:54
DADS DEFI SPACE
2026-09-21 04:54
Roz Arai Ch.
2026-09-21 04:54
Levi
2026-09-21 04:54
Chan Wei Khjan
2026-09-21 04:35
ICON TV - Polars
2026-09-21 04:35
Kripto Detayı
2026-09-21 04:35
PI News World
2026-09-21 02:35
选择货币
US Dollar
USD
Chinese Yuan
CNY
Japanese Yen
JPY
South Korean Won
KRW
New Taiwan Dollar
TWD
Canadian Dollar
CAD
Euro
EUR
Pound Sterling
GBP
Danish Krone
DKK
Hong Kong Dollar
HKD
Australian Dollar
AUD
Brazilian Real
BRL
Swiss Franc
CHF
Chilean Peso
CLP
Czech Koruna KČ
CZK
Singapore Dollar
SGD
Indian Rupee
INR
Saudi Riyal
SAR
Vietnamese Dong
VND
Thai Baht
THB
选择货币
US Dollar
USD-$
Chinese Yuan
CNY-¥
Japanese Yen
JPY-¥
South Korean Won
KRW -₩
New Taiwan Dollar
TWD-NT$
Canadian Dollar
CAD-$
Euro
EUR - €
Pound Sterling
GBP-£
Danish Krone
DKK-KR
Hong Kong Dollar
HKD- $
Australian Dollar
AUD-$
Brazilian Real
BRL -R$
Swiss Franc
CHF -FR
Chilean Peso
CLP-$
Czech Koruna KČ
CZK -KČ
Singapore Dollar
SGD-S$
Indian Rupee
INR -₹
Saudi Riyal
SAR -SAR
Vietnamese Dong
VND-₫
Thai Baht
THB -฿