价格: $0.08746 -1.7955%
市值: $15.02B 0.5403%
成交额 (24h): 976.34M 0%
统治地位: 0.5403%
Price: $0.08746 -1.7955%
市值: $15.02B 0.5403%
成交额 (24h): 976.34M 0%
统治地位: 0.5403% 0.5403%
  • 价格: $0.08746 -1.7955%
  • 市值: 15.02B 0.5403%
  • 成交额 (24h): 976.34M 0%
  • 统治地位: 0.5403% 0.5403%
  • 价格: $0.08746 -1.7955%
首页 > 视频 > 这个AI模型的配置文件的每一行都是一张纸

这个AI模型的配置文件的每一行都是一张纸

发布: 2026/08/19 08:00 阅读: 0

原文作者:CloudAICode

原文来源:https://www.youtube.com/embed/KridVjxKMdo

#qwen #deepseek #flashattention 没有人能跟上人工智能研究的步伐,人们给你的阅读清单是根据论文的有趣程度而不是你的花费来排名的。相反,打开前沿开放模型的配置文件,排名会自动写入:其中的每一行都是某人必须首先发表的论文,只有其中的少数人决定您的服务账单是否需要支付。该视频逐行读取一个配置文件,并根据其实际购买的内容对后面的 11 篇论文进行排名。它从一个 2.4 万亿个参数文件开始,其中每个代币有 512 名专家,旁边有 10 名专家,因此 950 亿个参数打开,其余参数处于睡眠状态,并追溯到 Shazeer 2017 年的稀疏门控专家混合,以及其声称的 1370 亿个参数的 1000 倍容量增益。然后是 FlashAttention,其中的见解是 IO 意识而不是更好的数学:第一篇论文中 GPT-2 的利用率为 3 倍,版本 3 中 Hopper 的利用率为 35% 到 75%,版本 4 中每秒 1,613 teraflops,B200 的利用率为 71%,加上与四年前的论文相比,四个星期内发布了四个版本。旋转嵌入是由Jianlin Su在RoFormer前四个星期发表的一篇中文博客文章,在Qwen中以1000万绳索θ的形式出现,在GLM中以800万绳索θ的形式出现,在DeepSeek中以缩放块形式出现10,000的绳索θ。缓存沿袭从 2019 年的多查询注意力,到 64 个查询头到 4 个键值头的分组查询注意力,分页注意力和 vLLM 的 2 到 4 倍吞吐量,到 DeepSeek 的潜在注意力削减了 93.3% 的缓存,从 65,536 计算出 1,048,576 个令牌上下文,乘以 16 倍,并以冷价格的 31 倍缓存输入。其他七个也被阅读:思想链和德克萨斯大学审计发现符号任务获得了 14.2 分,数学获得了 12.3 分,但在其他地方几乎没有获得什么,ReAct 及其三种已知的故障模式,GraphRAG 和同一作者在七个月后发布的更便宜的方法,MCP 和 A2A,CLIP 和 BLIP,以及隐藏在文件中作为索引 topk 的关于学习稀疏索引的第十二个条目。该排名是为那些为推理付费的人而写的,如果你不这样做,那么它的价值就会降低。将模型视为已解决的商品,在调用和订单翻转之间的空间中解决您的难题,首先进行 ReAct 和检索工作,效率四可以等待一个月。 FlashAttention 4 的数字也来自测试版标签,但尚未发布稳定版本。 ⏱️ TIMESTAMPS:00:00 - 打开配置文件 00:21 - 512 名专家,10 名清醒 00:37 - 2017 年稀疏性论文 01:45 - Flash 注意力是 IO 感知的 03:22 - 来自博客文章的旋转嵌入 04:43 - 服务资金去向 05:42 - 分组查询注意力06:04 - 分页注意力和 vLLM 06:31 - 潜在注意力减少 93% 07:26 - 思想链,经过审核 08:28 - ReAct 和代理循环 09:12 - GraphRAG 及其更便宜的续集 10:54 - 排名,未对冲 12:20 - 第 12 篇论文和一个赌注 🔗 支付租金的四个:惊人的大型神经网络(稀疏门控专家混合体,2017) https://arxiv.org/abs/1701.06538 FlashAttention(IO 感知精确注意力) https://arxiv.org/abs/2205.14135 flash-attention(您固定的存储库,而不是引用) https://github.com/Dao-AILab/flash-attention RoFormer(旋转位置嵌入) https://arxiv.org/abs/2104.09864 苏建林的博客,旋转首先出现 https://kexue.fm Fast Transformer Decoding(多查询注意力,2019) https://arxiv.org/abs/1911.02150 GQA(分组查询注意力) https://arxiv.org/abs/2305.13245 PagedAttention 和 vLLM https://arxiv.org/abs/2309.06180 vLLM(服务引擎) https://github.com/vllm-project/vllm DeepSeek-V2(多头潜在注意力) https://arxiv.org/abs/2405.04434 ⚡ 其他七个,第十二个: • 思想链提示https://arxiv.org/abs/2201.11903 • To CoT or not to CoT(德克萨斯大学荟萃分析) • ReAct(原因与行动) https://arxiv.org/abs/2210.03629 • GraphRAG(微软研究院) https://arxiv.org/abs/2404.16130 • LazyGraphRAG(同一作者的更便宜的后续产品) •模型上下文协议 https://modelcontextprotocol.io • A2A 协议(Linux 基金会) • CLIP(学习可转移视觉模型) https://arxiv.org/abs/2103.00020 • BLIP(标题、过滤器、引导程序) https://arxiv.org/abs/2201.12086 #qwen #deepseek #flashattention #mixtureofexperts #kvcache #vllm #aipapers #llm #machinelearning 👇 订阅并观看下一篇 每周订阅一个新的深入研究:https://www.youtube.com/@CloudAICode 用户查询:llm 配置文件中有哪些论文 qwen 配置文件解释了专家的混合解释了 flash 注意力如何工作 llms 中的 kv 缓存分组查询注意力与多查询注意力绳 theta 解释了分页注意力如何工作是思想链仍然有用最好的人工智能论文阅读

精选专题

  • 狗狗币鲸鱼活动
    狗狗币鲸鱼活动
    通过我们的综合分析,了解狗狗币鲸鱼活动的最新见解。了解趋势、模式以及这些鲸鱼对狗狗币市场的影响。随时了解我们的专家分析,并在您的加密货币之旅中保持领先。
  • 狗狗币挖矿
    狗狗币挖矿
    狗狗币挖矿是向狗狗币区块链添加新交易块的过程。矿工因其工作而获得新的狗狗币奖励。本主题提供与狗狗币挖矿相关的文章,包括如何挖矿狗狗币、最好的挖矿硬件和软件以及狗狗币挖矿的盈利能力。
  • SpaceX 星舰发射
    SpaceX 星舰发射
    本主题提供与 SpaceX 星舰发射相关的文章,包括发射日期、任务详细信息和发射状态。通过此信息丰富且全面的资源,了解最新的 SpaceX 星际飞船发射情况。
  • 模因之王:狗狗币
    模因之王:狗狗币
    本主题提供与最流行的模因相关的文章,包括“模因之王:狗狗币”。 Memecoin 已成为加密货币领域的主导者。这些数字资产之所以受欢迎有多种原因。他们推动了区块链最具创新性的方面。