人工智能前沿技术解读 · 按栏目浏览全部文章
↗
寻想集团-超级人工智能有限公司
西藏
首页
大模型架构与训练
多模态理解
智能体系统
研究方法
应用实践
全部文章
全部文章
栏目文章
大模型架构与训练
从注意力结构、规模定律到长上下文能力,理解大模型本身的工程约束。
大模型架构为什么收敛到同一种形式
注意力机制成为通用选择之后,架构变体主要在位置处理与长程结构上做文章。
大模型架构与训练
预训练阶段与规模定律
规模定律描述的是可预测性,不是"越大越好"的保证。
大模型架构与训练
长上下文到底解决了什么问题
把更多材料放进一次请求,解决的是"读得完",而不是"想得对"。
大模型架构与训练
中文分词为什么会改变上下文预算
同样的字数,不同分词器可能产生不同的输入长度。
大模型架构与训练
全部文章
大模型架构与训练
多模态理解
智能体系统
研究方法
应用实践