"vscode:/vscode.git/clone" did not exist on "842f6658e286f21f0212ae36ad2114125d81d46a"
Commit fd1124b0 authored by Rayyyyy's avatar Rayyyyy
Browse files

Update README

parent 06049edc
...@@ -9,6 +9,11 @@ Llama-3中选择了一个相对标准的decoder-only的transformer架构。与Ll ...@@ -9,6 +9,11 @@ Llama-3中选择了一个相对标准的decoder-only的transformer架构。与Ll
- 采用分组查询注意力(grouped query attention,GQA)、掩码等技术,帮助开发者以最低的能耗获取绝佳的性能。 - 采用分组查询注意力(grouped query attention,GQA)、掩码等技术,帮助开发者以最低的能耗获取绝佳的性能。
- 在8,192个tokens的序列上训练模型,使用掩码来确保self-attention不会跨越文档边界。 - 在8,192个tokens的序列上训练模型,使用掩码来确保self-attention不会跨越文档边界。
## 算法原理
<div align=center>
<img src="./doc/method.png"/>
</div>
## 环境配置 ## 环境配置
-v 路径、docker_name和imageID根据实际情况修改 -v 路径、docker_name和imageID根据实际情况修改
......
Markdown is supported
0% or .
You are about to add 0 people to the discussion. Proceed with caution.
Finish editing this message first!
Please register or to comment