通过 Ollama 体验 Llama 3
原文由 Michael Lynch 于 发布,订阅该博客
我看到 Meta 发布了 Llama 3 AI 模型,大家似乎都很期待,所以我决定试一试。
我之前没什么运行开源 AI 模型的经验,也没找到太多关于如何运行的相关文档。折腾了几个小时后,我成功用 Ollama 把 Llama 3 跑了起来,所以想把操作步骤分享出来。
准备一台带 GPU 的云服务器
为了做这个实验,我在 Scaleway 上创建了如下配置的服务器:
- 服务器实例类型:GPU-3070-S
- 操作系统:Ubuntu Focal
- 磁盘大小:100 GB(因为模型很大,需要这么大的空间)
为了通过 SSH 连接,我执行了下面的命令并做了端口转发,因为我需要访问服务器上运行在 localhost 上的网页界面。
TARGET_IP='51.159.184.186' # Change to your server's IP.
REMOTE_PORT='8080'
LOCAL_PORT='8080'
# SSH in and port-forward a port to access the Open-WebUI web interface.
ssh "${TARGET_IP}" -L "${REMOTE_PORT}:localhost:${LOCAL_PORT}"安装 CUDA
首先,安装 CUDA 以便让 Ollama 能够使用 GPU:
sudo apt-get install linux-headers-$(uname -r) && \
sudo apt-key del 7fa2af80 && \
echo "deb [signed-by=/usr/share/keyrings/cudatools.gpg] https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/ /" | sudo tee /etc/apt/sources.list.d/cuda-ubuntu2204-x86_64.list && \
wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/cuda-ubuntu2204.pin && \
sudo mv cuda-ubuntu2204.pin /etc/apt/preferences.d/cuda-repository-pin-600 && \
sudo apt-get update && \
sudo apt-get install -y cuda-toolkit nvidia-container-toolkit ca-certificates curl安装 Docker
接下来,安装 Docker,这样你就可以在 Ollama 的 Open-WebUI 网页界面下运行 Ollama:
sudo install -m 0755 -d /etc/apt/keyrings && \
sudo curl -fsSL https://download.docker.com/linux/ubuntu/gpg -o /etc/apt/keyrings/docker.asc && \
sudo chmod a+r /etc/apt/keyrings/docker.asc && \
echo \
"deb [arch=$(dpkg --print-architecture) signed-by=/etc/apt/keyrings/docker.asc] https://download.docker.com/linux/ubuntu \
$(. /etc/os-release && echo "$VERSION_CODENAME") stable" | \
sudo tee /etc/apt/sources.list.d/docker.list > /dev/null && \
sudo apt-get update && \
sudo apt-get install docker-ce docker-ce-cli containerd.io docker-buildx-plugin docker-compose-plugin && \
sudo usermod -aG docker "${USER}" && \
newgrp docker要测试是否一切正常,请运行以下命令:
docker run hello-world启动 Ollama 和 Open-WebUI
我基于标准的 Open-WebUI Docker Compose 文件改了一个适用于 Ollama 的版本,你可以用下面的命令下载并运行:
wget https://mtlynch.io/notes/ollama-llama3/docker-compose.yml && \
docker-compose up服务器启动并运行后,在浏览器中访问以下网址:
你首先会看到一个提示登录的页面,点击“Sign up”。

然后随便填一些信息就行。据我观察,并不需要填写有效的邮箱。

接下来,你需要下载一个模型才能使用。点击设置按钮:

我不太清楚各个模型之间有什么区别,不过 Llama 3 是几天前刚发布的最新模型,所以我决定试试这个。ollama.com 上说 llama3:70b 针对聊天机器人场景做了优化,所以我一开始用的是这个,但速度非常慢。后来我换成了 llama3,运行效果就好多了:

进度条会在 100% 上停留一段时间,但只有在看到弹出提示模型已完全下载完成时,才算真正下载好了。
下载完成后,关闭设置对话框,然后从下拉菜单中选择 llama3:latest:

接下来,你就可以开始体验 Llama 3 了。下面是我让 Llama 3 扮演 Nathan Fielder 与它对话的例子:

随机一篇博客
评论
登录后参与讨论