how-to-self-host-llama-2-on-a-5month-digitalocean-droplet

2026年08月11日 | 来源:
信息源:

📋 多平台草稿预览 (12平台差异化改编)

月付5美元,10分钟搞定:我把Llama 2塞进了廉价云服务器

别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。


别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

就在上周,我的一位朋友还在为调用GPT-4 API的账单发愁——一个月下来,光测试对话就烧掉了上百美元。他问我:“有没有更便宜的办法?”

答案是肯定的,而且比大多数人想象的要简单得多。今天,我们要聊的不是什么高深莫测的技术,而是一个朴素得近乎“土气”的方案:在月租5美元的DigitalOcean服务器上,自己托管Meta开源的Llama 2模型。整个过程,10分钟搞定。

为什么“自托管”突然成了香饽饽?

先来看一组数据。OpenAI的GPT-4定价为每千个输入token 0.03美元,Anthropic的Claude是0.008美元。听起来不多?但如果你需要处理大量文本、做批量推理、或者构建一个日活过万的AI应用,这笔费用会像滚雪球一样膨胀。

更关键的问题在于:你依赖的API随时可能涨价、限流,甚至因为服务商的政策调整而一夜之间变得不可用。自托管开源模型,意味着你拿回了数据主权和成本控制权

Llama 2是Meta于2023年7月发布的开源大语言模型,包含70亿、130亿和700亿参数三种规格。其中7B版本在量化后,对硬件的要求低得惊人——这正是它在廉价云服务器上运行的基础。

硬件够吗?别被“大模型”三个字吓到

很多人一听到“大语言模型”,脑海中浮现的是英伟达A100集群。但实际上,Llama 2 7B在4-bit量化后,模型大小仅为3.5GB左右,推理时的内存占用可以控制在5GB以内。

DigitalOcean最便宜的Droplet配置是1核CPU、1GB内存、25GB SSD。坦白说,这个配置跑Llama 2会很吃力——但别忘了,DigitalOcean每月5美元只是起点。实际上,我推荐至少选择2GB内存的配置(大约12美元/月),或者使用其他提供类似优惠的云服务商。

等等,这篇文章的标题不是说5美元吗?别急,下面我会讲到如何优化。

实战:10分钟部署指南

第一步:创建Droplet

登录DigitalOcean控制台,创建一个Ubuntu 22.04的Droplet。选择2GB/1核的配置(约12美元/月),或者如果你真的想挑战极限,1GB内存也不是完全不行——只是会频繁触发Swap。

第二步:安装依赖

SSH登录服务器后,依次执行:

apt update && apt install -y python3-pip git
pip3 install llama-cpp-python

这里我们使用llama-cpp-python,它是llama.cpp的Python绑定。llama.cpp是Georgi Gerganov开发的高性能推理库,专为在CPU上运行量化模型而优化——这让我们完全绕开了GPU的昂贵成本

第三步:下载量化模型

Hugging Face上有大量Llama 2的GGUF量化版本(GGUF是llama.cpp的模型格式)。以TheBloke的Llama-2-7B-Chat-GGUF为例:

wget https://huggingface.co/TheBloke/Llama-2-7B-Chat-GGUF/resolve/main/llama-2-7b-chat.Q4_K_M.gguf

这个文件大约3.8GB,下载可能需要几分钟。

第四步:启动推理服务

from llama_cpp import Llama

llm = Llama(model_path="./llama-2-7b-chat.Q4_K_M.gguf", n_ctx=2048)

output = llm(
    "Q: 什么是机器学习?A:",
    max_tokens=256,
    temperature=0.7,
    echo=True
)

print(output["choices"][0]["text"])

如果你想要一个HTTP API服务,可以使用llama-cpp-python自带的服务器:

python3 -m llama_cpp.server --model ./llama-2-7b-chat.Q4_K_M.gguf --n_ctx 2048

这样你就拥有了一个本地OpenAI兼容API,可以无缝替换GPT-4调用。

性能实测:够用吗?

在2GB内存的Droplet上,Llama 2 7B的推理速度大约为每秒3-5个token。这个速度对于实时聊天来说偏慢,但对于批量处理、异步任务或者对延迟不敏感的场景完全够用。

如果你愿意多花一点钱升级到4GB内存(约24美元/月),推理速度可以提升到每秒8-10个token,体验会流畅很多。

省钱策略:5美元方案的真实成本

现在回到标题的“5美元”问题。事实上,DigitalOcean的5美元/月配置(1GB内存)运行Llama 2 7B非常勉强,几乎必须依赖Swap分区,推理速度会降到每秒1-2个token。

但如果你换个思路——使用更小的模型呢? 比如Meta的Llama 2 3B(尚未发布)或者微软的Phi-2(27亿参数),在1GB内存上可以跑得不错。又或者,你可以使用更激进的量化(如Q2_K),牺牲一些质量来换取速度。

实际上,更聪明的做法是利用DigitalOcean的免费额度。新用户通常会获得200美元的赠送额度(参考文末链接),这意味着你可以在几个月内“免费”使用更高配置的服务器。

自托管的真正价值

省下的钱只是表面收益。自托管带来的深层价值包括:

1. 数据隐私:你的对话数据不会离开你的服务器

2. 无速率限制:没有每分钟调用次数上限

3. 完全控制:可以微调模型、修改推理参数

4. 离线可用:不依赖外部API的可用性

当然,代价是你需要自己处理运维——模型更新、安全补丁、性能调优。但这对于技术人员来说,恰恰是一种乐趣。

未来展望

随着Llama 3、Mistral等更高效的开源模型不断涌现,以及量化技术和推理引擎的持续优化,AI自托管的门槛正在急剧降低。也许在不久的将来,每个开发者都会在自己的笔记本电脑上运行一个私人AI助手,就像今天每个人都拥有一个本地数据库一样自然。

到那时,API提供商们可能需要重新思考他们的定价策略了——毕竟,当开源模型的能力追平闭源模型时,人们为什么还要为token付费呢?



写于彩虹洋葱 AI 聚合平台 · 如果你也对科技趋势感兴趣,欢迎交流。

🏷️ #开源AI · #LLM部署 · #云计算

快手短视频脚本 | 时长:30-40秒

【封面字幕】(大号字体,居中)

月付5美元,10分钟搞定:我把Llama 2塞进了廉价云服务器

【口播文案】(接地气风格,口语化)

老铁们,今天聊个硬核的——别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

核心就三点:

① (从正文提取第一个关键信息)

② (从正文提取第二个关键信息)

③ (从正文提取第三个关键信息)

懂的点个赞,不懂的评论区问我,下条见!💪


🏷️ 推荐标签:#开源AI, #LLM部署, #云计算

【微博短帖 | 140字以内核心版】

月付5美元,10分钟搞定:我把Llama 2塞进了廉价云服务器:别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

##开源AI ##LLM部署 ##云计算


【微博长帖 | 可配图 9 宫格版】

月付5美元,10分钟搞定:我把Llama 2塞进了廉价云服务器

别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

##开源AI ##LLM部署 ##云计算 🔗 https://dev.to/ramosai/how-to-self-host-llama-2-on-a-5month-digitalocean-droplet-cf1

月付5美元,10分钟搞定:我把Llama 2塞进了廉价云服务器

前言

别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。


别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

就在上周,我的一位朋友还在为调用GPT-4 API的账单发愁——一个月下来,光测试对话就烧掉了上百美元。他问我:“有没有更便宜的办法?”

答案是肯定的,而且比大多数人想象的要简单得多。今天,我们要聊的不是什么高深莫测的技术,而是一个朴素得近乎“土气”的方案:在月租5美元的DigitalOcean服务器上,自己托管Meta开源的Llama 2模型。整个过程,10分钟搞定。

为什么“自托管”突然成了香饽饽?

先来看一组数据。OpenAI的GPT-4定价为每千个输入token 0.03美元,Anthropic的Claude是0.008美元。听起来不多?但如果你需要处理大量文本、做批量推理、或者构建一个日活过万的AI应用,这笔费用会像滚雪球一样膨胀。

更关键的问题在于:你依赖的API随时可能涨价、限流,甚至因为服务商的政策调整而一夜之间变得不可用。自托管开源模型,意味着你拿回了数据主权和成本控制权

Llama 2是Meta于2023年7月发布的开源大语言模型,包含70亿、130亿和700亿参数三种规格。其中7B版本在量化后,对硬件的要求低得惊人——这正是它在廉价云服务器上运行的基础。

硬件够吗?别被“大模型”三个字吓到

很多人一听到“大语言模型”,脑海中浮现的是英伟达A100集群。但实际上,Llama 2 7B在4-bit量化后,模型大小仅为3.5GB左右,推理时的内存占用可以控制在5GB以内。

DigitalOcean最便宜的Droplet配置是1核CPU、1GB内存、25GB SSD。坦白说,这个配置跑Llama 2会很吃力——但别忘了,DigitalOcean每月5美元只是起点。实际上,我推荐至少选择2GB内存的配置(大约12美元/月),或者使用其他提供类似优惠的云服务商。

等等,这篇文章的标题不是说5美元吗?别急,下面我会讲到如何优化。

实战:10分钟部署指南

第一步:创建Droplet

登录DigitalOcean控制台,创建一个Ubuntu 22.04的Droplet。选择2GB/1核的配置(约12美元/月),或者如果你真的想挑战极限,1GB内存也不是完全不行——只是会频繁触发Swap。

第二步:安装依赖

SSH登录服务器后,依次执行:

apt update && apt install -y python3-pip git
pip3 install llama-cpp-python

这里我们使用llama-cpp-python,它是llama.cpp的Python绑定。llama.cpp是Georgi Gerganov开发的高性能推理库,专为在CPU上运行量化模型而优化——这让我们完全绕开了GPU的昂贵成本

第三步:下载量化模型

Hugging Face上有大量Llama 2的GGUF量化版本(GGUF是llama.cpp的模型格式)。以TheBloke的Llama-2-7B-Chat-GGUF为例:

wget https://huggingface.co/TheBloke/Llama-2-7B-Chat-GGUF/resolve/main/llama-2-7b-chat.Q4_K_M.gguf

这个文件大约3.8GB,下载可能需要几分钟。

第四步:启动推理服务

from llama_cpp import Llama

llm = Llama(model_path="./llama-2-7b-chat.Q4_K_M.gguf", n_ctx=2048)

output = llm(
    "Q: 什么是机器学习?A:",
    max_tokens=256,
    temperature=0.7,
    echo=True
)

print(output["choices"][0]["text"])

如果你想要一个HTTP API服务,可以使用llama-cpp-python自带的服务器:

python3 -m llama_cpp.server --model ./llama-2-7b-chat.Q4_K_M.gguf --n_ctx 2048

这样你就拥有了一个本地OpenAI兼容API,可以无缝替换GPT-4调用。

性能实测:够用吗?

在2GB内存的Droplet上,Llama 2 7B的推理速度大约为每秒3-5个token。这个速度对于实时聊天来说偏慢,但对于批量处理、异步任务或者对延迟不敏感的场景完全够用。

如果你愿意多花一点钱升级到4GB内存(约24美元/月),推理速度可以提升到每秒8-10个token,体验会流畅很多。

省钱策略:5美元方案的真实成本

现在回到标题的“5美元”问题。事实上,DigitalOcean的5美元/月配置(1GB内存)运行Llama 2 7B非常勉强,几乎必须依赖Swap分区,推理速度会降到每秒1-2个token。

但如果你换个思路——使用更小的模型呢? 比如Meta的Llama 2 3B(尚未发布)或者微软的Phi-2(27亿参数),在1GB内存上可以跑得不错。又或者,你可以使用更激进的量化(如Q2_K),牺牲一些质量来换取速度。

实际上,更聪明的做法是利用DigitalOcean的免费额度。新用户通常会获得200美元的赠送额度(参考文末链接),这意味着你可以在几个月内“免费”使用更高配置的服务器。

自托管的真正价值

省下的钱只是表面收益。自托管带来的深层价值包括:

1. 数据隐私:你的对话数据不会离开你的服务器

2. 无速率限制:没有每分钟调用次数上限

3. 完全控制:可以微调模型、修改推理参数

4. 离线可用:不依赖外部API的可用性

当然,代价是你需要自己处理运维——模型更新、安全补丁、性能调优。但这对于技术人员来说,恰恰是一种乐趣。

未来展望

随着Llama 3、Mistral等更高效的开源模型不断涌现,以及量化技术和推理引擎的持续优化,AI自托管的门槛正在急剧降低。也许在不久的将来,每个开发者都会在自己的笔记本电脑上运行一个私人AI助手,就像今天每个人都拥有一个本地数据库一样自然。

到那时,API提供商们可能需要重新思考他们的定价策略了——毕竟,当开源模型的能力追平闭源模型时,人们为什么还要为token付费呢?



总结

本文梳理了相关技术/事件的核心脉络。如有错误欢迎在评论区指正。


📂 分类:#开源AI · #LLM部署 · #云计算

© 本文由彩虹洋葱 AI 自动聚合,转载请注明出处。

月付5美元,10分钟搞定:我把Llama 2塞进了廉价云服务器

别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

就在上周,我的一位朋友还在为调用GPT-4 API的账单发愁——一个月下来,光测试对话就烧掉了上百美元。他问我:“有没有更便宜的办法?”

答案是肯定的,而且比大多数人想象的要简单得多。今天,我们要聊的不是什么高深莫测的技术,而是一个朴素得近乎“土气”的方案:在月租5美元的DigitalOcean服务器上,自己托管Meta开源的Llama 2模型。整个过程,10分钟搞定。

为什么“自托管”突然成了香饽饽?

先来看一组数据。OpenAI的GPT-4定价为每千个输入token 0.03美元,Anthropic的Claude是0.008美元。听起来不多?但如果你需要处理大量文本、做批量推理、或者构建一个日活过万的AI应用,这笔费用会像滚雪球一样膨胀。

更关键的问题在于:你依赖的API随时可能涨价、限流,甚至因为服务商的政策调整而一夜之间变得不可用。自托管开源模型,意味着你拿回了数据主权和成本控制权

Llama 2是Meta于2023年7月发布的开源大语言模型,包含70亿、130亿和700亿参数三种规格。其中7B版本在量化后,对硬件的要求低得惊人——这正是它在廉价云服务器上运行的基础。

硬件够吗?别被“大模型”三个字吓到

很多人一听到“大语言模型”,脑海中浮现的是英伟达A100集群。但实际上,Llama 2 7B在4-bit量化后,模型大小仅为3.5GB左右,推理时的内存占用可以控制在5GB以内。

DigitalOcean最便宜的Droplet配置是1核CPU、1GB内存、25GB SSD。坦白说,这个配置跑Llama 2会很吃力——但别忘了,DigitalOcean每月5美元只是起点。实际上,我推荐至少选择2GB内存的配置(大约12美元/月),或者使用其他提供类似优惠的云服务商。

等等,这篇文章的标题不是说5美元吗?别急,下面我会讲到如何优化。

实战:10分钟部署指南

第一步:创建Droplet

登录DigitalOcean控制台,创建一个Ubuntu 22.04的Droplet。选择2GB/1核的配置(约12美元/月),或者如果你真的想挑战极限,1GB内存也不是完全不行——只是会频繁触发Swap。

第二步:安装依赖

SSH登录服务器后,依次执行:

apt update && apt install -y python3-pip git
pip3 install llama-cpp-python

这里我们使用llama-cpp-python,它是llama.cpp的Python绑定。llama.cpp是Georgi Gerganov开发的高性能推理库,专为在CPU上运行量化模型而优化——这让我们完全绕开了GPU的昂贵成本

第三步:下载量化模型

Hugging Face上有大量Llama 2的GGUF量化版本(GGUF是llama.cpp的模型格式)。以TheBloke的Llama-2-7B-Chat-GGUF为例:

wget https://huggingface.co/TheBloke/Llama-2-7B-Chat-GGUF/resolve/main/llama-2-7b-chat.Q4_K_M.gguf

这个文件大约3.8GB,下载可能需要几分钟。

第四步:启动推理服务

from llama_cpp import Llama

llm = Llama(model_path="./llama-2-7b-chat.Q4_K_M.gguf", n_ctx=2048)

output = llm(
    "Q: 什么是机器学习?A:",
    max_tokens=256,
    temperature=0.7,
    echo=True
)

print(output["choices"][0]["text"])

如果你想要一个HTTP API服务,可以使用llama-cpp-python自带的服务器:

python3 -m llama_cpp.server --model ./llama-2-7b-chat.Q4_K_M.gguf --n_ctx 2048

这样你就拥有了一个本地OpenAI兼容API,可以无缝替换GPT-4调用。

性能实测:够用吗?

在2GB内存的Droplet上,Llama 2 7B的推理速度大约为每秒3-5个token。这个速度对于实时聊天来说偏慢,但对于批量处理、异步任务或者对延迟不敏感的场景完全够用。

如果你愿意多花一点钱升级到4GB内存(约24美元/月),推理速度可以提升到每秒8-10个token,体验会流畅很多。

省钱策略:5美元方案的真实成本

现在回到标题的“5美元”问题。事实上,DigitalOcean的5美元/月配置(1GB内存)运行Llama 2 7B非常勉强,几乎必须依赖Swap分区,推理速度会降到每秒1-2个token。

但如果你换个思路——使用更小的模型呢? 比如Meta的Llama 2 3B(尚未发布)或者微软的Phi-2(27亿参数),在1GB内存上可以跑得不错。又或者,你可以使用更激进的量化(如Q2_K),牺牲一些质量来换取速度。

实际上,更聪明的做法是利用DigitalOcean的免费额度。新用户通常会获得200美元的赠送额度(参考文末链接),这意味着你可以在几个月内“免费”使用更高配置的服务器。

自托管的真正价值

省下的钱只是表面收益。自托管带来的深层价值包括:

1. 数据隐私:你的对话数据不会离开你的服务器

2. 无速率限制:没有每分钟调用次数上限

3. 完全控制:可以微调模型、修改推理参数

4. 离线可用:不依赖外部API的可用性

当然,代价是你需要自己处理运维——模型更新、安全补丁、性能调优。但这对于技术人员来说,恰恰是一种乐趣。

未来展望

随着Llama 3、Mistral等更高效的开源模型不断涌现,以及量化技术和推理引擎的持续优化,AI自托管的门槛正在急剧降低。也许在不久的将来,每个开发者都会在自己的笔记本电脑上运行一个私人AI助手,就像今天每个人都拥有一个本地数据库一样自然。

到那时,API提供商们可能需要重新思考他们的定价策略了——毕竟,当开源模型的能力追平闭源模型时,人们为什么还要为token付费呢?



总结 & 思考

以上为当前进展的梳理。欢迎在评论区交流技术细节和不同观点。


🏷️ 标签:#开源AI · #LLM部署 · #云计算

👍 如果对你有帮助,请点赞收藏支持

月付5美元,10分钟搞定:我把Llama 2塞进了廉价云服务器

别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

就在上周,我的一位朋友还在为调用GPT-4 API的账单发愁——一个月下来,光测试对话就烧掉了上百美元。他问我:“有没有更便宜的办法?”

答案是肯定的,而且比大多数人想象的要简单得多。今天,我们要聊的不是什么高深莫测的技术,而是一个朴素得近乎“土气”的方案:在月租5美元的DigitalOcean服务器上,自己托管Meta开源的Llama 2模型。整个过程,10分钟搞定。

为什么“自托管”突然成了香饽饽?

先来看一组数据。OpenAI的GPT-4定价为每千个输入token 0.03美元,Anthropic的Claude是0.008美元。听起来不多?但如果你需要处理大量文本、做批量推理、或者构建一个日活过万的AI应用,这笔费用会像滚雪球一样膨胀。

更关键的问题在于:你依赖的API随时可能涨价、限流,甚至因为服务商的政策调整而一夜之间变得不可用。自托管开源模型,意味着你拿回了数据主权和成本控制权

Llama 2是Meta于2023年7月发布的开源大语言模型,包含70亿、130亿和700亿参数三种规格。其中7B版本在量化后,对硬件的要求低得惊人——这正是它在廉价云服务器上运行的基础。

硬件够吗?别被“大模型”三个字吓到

很多人一听到“大语言模型”,脑海中浮现的是英伟达A100集群。但实际上,Llama 2 7B在4-bit量化后,模型大小仅为3.5GB左右,推理时的内存占用可以控制在5GB以内。

DigitalOcean最便宜的Droplet配置是1核CPU、1GB内存、25GB SSD。坦白说,这个配置跑Llama 2会很吃力——但别忘了,DigitalOcean每月5美元只是起点。实际上,我推荐至少选择2GB内存的配置(大约12美元/月),或者使用其他提供类似优惠的云服务商。

等等,这篇文章的标题不是说5美元吗?别急,下面我会讲到如何优化。

实战:10分钟部署指南

第一步:创建Droplet

登录DigitalOcean控制台,创建一个Ubuntu 22.04的Droplet。选择2GB/1核的配置(约12美元/月),或者如果你真的想挑战极限,1GB内存也不是完全不行——只是会频繁触发Swap。

第二步:安装依赖

SSH登录服务器后,依次执行:

apt update && apt install -y python3-pip git
pip3 install llama-cpp-python

这里我们使用llama-cpp-python,它是llama.cpp的Python绑定。llama.cpp是Georgi Gerganov开发的高性能推理库,专为在CPU上运行量化模型而优化——这让我们完全绕开了GPU的昂贵成本

第三步:下载量化模型

Hugging Face上有大量Llama 2的GGUF量化版本(GGUF是llama.cpp的模型格式)。以TheBloke的Llama-2-7B-Chat-GGUF为例:

wget https://huggingface.co/TheBloke/Llama-2-7B-Chat-GGUF/resolve/main/llama-2-7b-chat.Q4_K_M.gguf

这个文件大约3.8GB,下载可能需要几分钟。

第四步:启动推理服务

from llama_cpp import Llama

llm = Llama(model_path="./llama-2-7b-chat.Q4_K_M.gguf", n_ctx=2048)

output = llm(
    "Q: 什么是机器学习?A:",
    max_tokens=256,
    temperature=0.7,
    echo=True
)

print(output["choices"][0]["text"])

如果你想要一个HTTP API服务,可以使用llama-cpp-python自带的服务器:

python3 -m llama_cpp.server --model ./llama-2-7b-chat.Q4_K_M.gguf --n_ctx 2048

这样你就拥有了一个本地OpenAI兼容API,可以无缝替换GPT-4调用。

性能实测:够用吗?

在2GB内存的Droplet上,Llama 2 7B的推理速度大约为每秒3-5个token。这个速度对于实时聊天来说偏慢,但对于批量处理、异步任务或者对延迟不敏感的场景完全够用。

如果你愿意多花一点钱升级到4GB内存(约24美元/月),推理速度可以提升到每秒8-10个token,体验会流畅很多。

省钱策略:5美元方案的真实成本

现在回到标题的“5美元”问题。事实上,DigitalOcean的5美元/月配置(1GB内存)运行Llama 2 7B非常勉强,几乎必须依赖Swap分区,推理速度会降到每秒1-2个token。

但如果你换个思路——使用更小的模型呢? 比如Meta的Llama 2 3B(尚未发布)或者微软的Phi-2(27亿参数),在1GB内存上可以跑得不错。又或者,你可以使用更激进的量化(如Q2_K),牺牲一些质量来换取速度。

实际上,更聪明的做法是利用DigitalOcean的免费额度。新用户通常会获得200美元的赠送额度(参考文末链接),这意味着你可以在几个月内“免费”使用更高配置的服务器。

自托管的真正价值

省下的钱只是表面收益。自托管带来的深层价值包括:

1. 数据隐私:你的对话数据不会离开你的服务器

2. 无速率限制:没有每分钟调用次数上限

3. 完全控制:可以微调模型、修改推理参数

4. 离线可用:不依赖外部API的可用性

当然,代价是你需要自己处理运维——模型更新、安全补丁、性能调优。但这对于技术人员来说,恰恰是一种乐趣。

未来展望

随着Llama 3、Mistral等更高效的开源模型不断涌现,以及量化技术和推理引擎的持续优化,AI自托管的门槛正在急剧降低。也许在不久的将来,每个开发者都会在自己的笔记本电脑上运行一个私人AI助手,就像今天每个人都拥有一个本地数据库一样自然。

到那时,API提供商们可能需要重新思考他们的定价策略了——毕竟,当开源模型的能力追平闭源模型时,人们为什么还要为token付费呢?



信息源:How to Self-Host Llama 2 on a $5/month DigitalOcean Droplet - Dev.to 标签:#开源AI, #LLM部署, #云计算

月付5美元,10分钟搞定:我把Llama 2塞进了廉价云服务器

摘要:> 别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

就在上周,我的一位朋友还在为调用GPT-4 API的账单发愁——一个月下来,光测试对话就烧掉了上百美元。他问我:“有没有更便宜的办法?”

答案是肯定的,而且比大多数人想象的要简单得多。今天,我们要聊的不是什么高深……


别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

就在上周,我的一位朋友还在为调用GPT-4 API的账单发愁——一个月下来,光测试对话就烧掉了上百美元。他问我:“有没有更便宜的办法?”

答案是肯定的,而且比大多数人想象的要简单得多。今天,我们要聊的不是什么高深莫测的技术,而是一个朴素得近乎“土气”的方案:在月租5美元的DigitalOcean服务器上,自己托管Meta开源的Llama 2模型。整个过程,10分钟搞定。

为什么“自托管”突然成了香饽饽?

先来看一组数据。OpenAI的GPT-4定价为每千个输入token 0.03美元,Anthropic的Claude是0.008美元。听起来不多?但如果你需要处理大量文本、做批量推理、或者构建一个日活过万的AI应用,这笔费用会像滚雪球一样膨胀。

更关键的问题在于:你依赖的API随时可能涨价、限流,甚至因为服务商的政策调整而一夜之间变得不可用。自托管开源模型,意味着你拿回了数据主权和成本控制权

Llama 2是Meta于2023年7月发布的开源大语言模型,包含70亿、130亿和700亿参数三种规格。其中7B版本在量化后,对硬件的要求低得惊人——这正是它在廉价云服务器上运行的基础。

硬件够吗?别被“大模型”三个字吓到

很多人一听到“大语言模型”,脑海中浮现的是英伟达A100集群。但实际上,Llama 2 7B在4-bit量化后,模型大小仅为3.5GB左右,推理时的内存占用可以控制在5GB以内。

DigitalOcean最便宜的Droplet配置是1核CPU、1GB内存、25GB SSD。坦白说,这个配置跑Llama 2会很吃力——但别忘了,DigitalOcean每月5美元只是起点。实际上,我推荐至少选择2GB内存的配置(大约12美元/月),或者使用其他提供类似优惠的云服务商。

等等,这篇文章的标题不是说5美元吗?别急,下面我会讲到如何优化。

实战:10分钟部署指南

第一步:创建Droplet

登录DigitalOcean控制台,创建一个Ubuntu 22.04的Droplet。选择2GB/1核的配置(约12美元/月),或者如果你真的想挑战极限,1GB内存也不是完全不行——只是会频繁触发Swap。

第二步:安装依赖

SSH登录服务器后,依次执行:

apt update && apt install -y python3-pip git
pip3 install llama-cpp-python

这里我们使用llama-cpp-python,它是llama.cpp的Python绑定。llama.cpp是Georgi Gerganov开发的高性能推理库,专为在CPU上运行量化模型而优化——这让我们完全绕开了GPU的昂贵成本

第三步:下载量化模型

Hugging Face上有大量Llama 2的GGUF量化版本(GGUF是llama.cpp的模型格式)。以TheBloke的Llama-2-7B-Chat-GGUF为例:

wget https://huggingface.co/TheBloke/Llama-2-7B-Chat-GGUF/resolve/main/llama-2-7b-chat.Q4_K_M.gguf

这个文件大约3.8GB,下载可能需要几分钟。

第四步:启动推理服务

from llama_cpp import Llama

llm = Llama(model_path="./llama-2-7b-chat.Q4_K_M.gguf", n_ctx=2048)

output = llm(
    "Q: 什么是机器学习?A:",
    max_tokens=256,
    temperature=0.7,
    echo=True
)

print(output["choices"][0]["text"])

如果你想要一个HTTP API服务,可以使用llama-cpp-python自带的服务器:

python3 -m llama_cpp.server --model ./llama-2-7b-chat.Q4_K_M.gguf --n_ctx 2048

这样你就拥有了一个本地OpenAI兼容API,可以无缝替换GPT-4调用。

性能实测:够用吗?

在2GB内存的Droplet上,Llama 2 7B的推理速度大约为每秒3-5个token。这个速度对于实时聊天来说偏慢,但对于批量处理、异步任务或者对延迟不敏感的场景完全够用。

如果你愿意多花一点钱升级到4GB内存(约24美元/月),推理速度可以提升到每秒8-10个token,体验会流畅很多。

省钱策略:5美元方案的真实成本

现在回到标题的“5美元”问题。事实上,DigitalOcean的5美元/月配置(1GB内存)运行Llama 2 7B非常勉强,几乎必须依赖Swap分区,推理速度会降到每秒1-2个token。

但如果你换个思路——使用更小的模型呢? 比如Meta的Llama 2 3B(尚未发布)或者微软的Phi-2(27亿参数),在1GB内存上可以跑得不错。又或者,你可以使用更激进的量化(如Q2_K),牺牲一些质量来换取速度。

实际上,更聪明的做法是利用DigitalOcean的免费额度。新用户通常会获得200美元的赠送额度(参考文末链接),这意味着你可以在几个月内“免费”使用更高配置的服务器。

自托管的真正价值

省下的钱只是表面收益。自托管带来的深层价值包括:

1. 数据隐私:你的对话数据不会离开你的服务器

2. 无速率限制:没有每分钟调用次数上限

3. 完全控制:可以微调模型、修改推理参数

4. 离线可用:不依赖外部API的可用性

当然,代价是你需要自己处理运维——模型更新、安全补丁、性能调优。但这对于技术人员来说,恰恰是一种乐趣。

未来展望

随着Llama 3、Mistral等更高效的开源模型不断涌现,以及量化技术和推理引擎的持续优化,AI自托管的门槛正在急剧降低。也许在不久的将来,每个开发者都会在自己的笔记本电脑上运行一个私人AI助手,就像今天每个人都拥有一个本地数据库一样自然。

到那时,API提供商们可能需要重新思考他们的定价策略了——毕竟,当开源模型的能力追平闭源模型时,人们为什么还要为token付费呢?



📌 来源:Dev.to | 标签:#开源AI · #LLM部署 · #云计算

本文由彩虹洋葱 AI 自动聚合生成,仅供参考,不构成任何投资或决策建议。

问题:如何看待「月付5美元,10分钟搞定:我把Llama 2塞进了廉价云服务器」?

别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。


别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

就在上周,我的一位朋友还在为调用GPT-4 API的账单发愁——一个月下来,光测试对话就烧掉了上百美元。他问我:“有没有更便宜的办法?”

答案是肯定的,而且比大多数人想象的要简单得多。今天,我们要聊的不是什么高深莫测的技术,而是一个朴素得近乎“土气”的方案:在月租5美元的DigitalOcean服务器上,自己托管Meta开源的Llama 2模型。整个过程,10分钟搞定。

为什么“自托管”突然成了香饽饽?

先来看一组数据。OpenAI的GPT-4定价为每千个输入token 0.03美元,Anthropic的Claude是0.008美元。听起来不多?但如果你需要处理大量文本、做批量推理、或者构建一个日活过万的AI应用,这笔费用会像滚雪球一样膨胀。

更关键的问题在于:你依赖的API随时可能涨价、限流,甚至因为服务商的政策调整而一夜之间变得不可用。自托管开源模型,意味着你拿回了数据主权和成本控制权

Llama 2是Meta于2023年7月发布的开源大语言模型,包含70亿、130亿和700亿参数三种规格。其中7B版本在量化后,对硬件的要求低得惊人——这正是它在廉价云服务器上运行的基础。

硬件够吗?别被“大模型”三个字吓到

很多人一听到“大语言模型”,脑海中浮现的是英伟达A100集群。但实际上,Llama 2 7B在4-bit量化后,模型大小仅为3.5GB左右,推理时的内存占用可以控制在5GB以内。

DigitalOcean最便宜的Droplet配置是1核CPU、1GB内存、25GB SSD。坦白说,这个配置跑Llama 2会很吃力——但别忘了,DigitalOcean每月5美元只是起点。实际上,我推荐至少选择2GB内存的配置(大约12美元/月),或者使用其他提供类似优惠的云服务商。

等等,这篇文章的标题不是说5美元吗?别急,下面我会讲到如何优化。

实战:10分钟部署指南

第一步:创建Droplet

登录DigitalOcean控制台,创建一个Ubuntu 22.04的Droplet。选择2GB/1核的配置(约12美元/月),或者如果你真的想挑战极限,1GB内存也不是完全不行——只是会频繁触发Swap。

第二步:安装依赖

SSH登录服务器后,依次执行:

apt update && apt install -y python3-pip git
pip3 install llama-cpp-python

这里我们使用llama-cpp-python,它是llama.cpp的Python绑定。llama.cpp是Georgi Gerganov开发的高性能推理库,专为在CPU上运行量化模型而优化——这让我们完全绕开了GPU的昂贵成本

第三步:下载量化模型

Hugging Face上有大量Llama 2的GGUF量化版本(GGUF是llama.cpp的模型格式)。以TheBloke的Llama-2-7B-Chat-GGUF为例:

wget https://huggingface.co/TheBloke/Llama-2-7B-Chat-GGUF/resolve/main/llama-2-7b-chat.Q4_K_M.gguf

这个文件大约3.8GB,下载可能需要几分钟。

第四步:启动推理服务

from llama_cpp import Llama

llm = Llama(model_path="./llama-2-7b-chat.Q4_K_M.gguf", n_ctx=2048)

output = llm(
    "Q: 什么是机器学习?A:",
    max_tokens=256,
    temperature=0.7,
    echo=True
)

print(output["choices"][0]["text"])

如果你想要一个HTTP API服务,可以使用llama-cpp-python自带的服务器:

python3 -m llama_cpp.server --model ./llama-2-7b-chat.Q4_K_M.gguf --n_ctx 2048

这样你就拥有了一个本地OpenAI兼容API,可以无缝替换GPT-4调用。

性能实测:够用吗?

在2GB内存的Droplet上,Llama 2 7B的推理速度大约为每秒3-5个token。这个速度对于实时聊天来说偏慢,但对于批量处理、异步任务或者对延迟不敏感的场景完全够用。

如果你愿意多花一点钱升级到4GB内存(约24美元/月),推理速度可以提升到每秒8-10个token,体验会流畅很多。

省钱策略:5美元方案的真实成本

现在回到标题的“5美元”问题。事实上,DigitalOcean的5美元/月配置(1GB内存)运行Llama 2 7B非常勉强,几乎必须依赖Swap分区,推理速度会降到每秒1-2个token。

但如果你换个思路——使用更小的模型呢? 比如Meta的Llama 2 3B(尚未发布)或者微软的Phi-2(27亿参数),在1GB内存上可以跑得不错。又或者,你可以使用更激进的量化(如Q2_K),牺牲一些质量来换取速度。

实际上,更聪明的做法是利用DigitalOcean的免费额度。新用户通常会获得200美元的赠送额度(参考文末链接),这意味着你可以在几个月内“免费”使用更高配置的服务器。

自托管的真正价值

省下的钱只是表面收益。自托管带来的深层价值包括:

1. 数据隐私:你的对话数据不会离开你的服务器

2. 无速率限制:没有每分钟调用次数上限

3. 完全控制:可以微调模型、修改推理参数

4. 离线可用:不依赖外部API的可用性

当然,代价是你需要自己处理运维——模型更新、安全补丁、性能调优。但这对于技术人员来说,恰恰是一种乐趣。

未来展望

随着Llama 3、Mistral等更高效的开源模型不断涌现,以及量化技术和推理引擎的持续优化,AI自托管的门槛正在急剧降低。也许在不久的将来,每个开发者都会在自己的笔记本电脑上运行一个私人AI助手,就像今天每个人都拥有一个本地数据库一样自然。

到那时,API提供商们可能需要重新思考他们的定价策略了——毕竟,当开源模型的能力追平闭源模型时,人们为什么还要为token付费呢?



总结: 以上分析基于公开信息整理。核心在于理解这一事件/技术背后的驱动力,而非停留在表面叙事。欢迎在评论区交流你的看法。

📎 参考来源:How to Self-Host Llama 2 on a $5/month DigitalOcean Droplet - Dev.to

🔗 原文链接:https://dev.to/ramosai/how-to-self-host-llama-2-on-a-5month-digitalocean-droplet-cf1

📺 B站视频脚本 | 时长:3-5分钟

【片头 0:00-0:15】BGM起 → 标题字幕弹出

月付5美元,10分钟搞定:我把Llama 2塞进了廉价云服务器

【引子 0:15-0:45】制造悬念

别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

【时间轴分镜】

├ [00:02] > 别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算……

├ [02:04] 就在上周,我的一位朋友还在为调用GPT-4 API的账单发愁——一个月下来,光测试对话就烧掉了上百美元。他问我:“有没有更便宜的办法?”……

├ [04:06] 答案是肯定的,而且比大多数人想象的要简单得多。今天,我们要聊的不是什么高深莫测的技术,而是一个朴素得近乎“土气”的方案:在月租5美元的DigitalOcean服……

├ [06:08] 先来看一组数据。OpenAI的GPT-4定价为每千个输入token 0.03美元,Anthropic的Claude是0.008美元。听起来不多?但如果你需要处理……

├ [08:10] 更关键的问题在于:你依赖的API随时可能涨价、限流,甚至因为服务商的政策调整而一夜之间变得不可用。自托管开源模型,意味着你拿回了数据主权和成本控制权。……

├ [结尾] 总结 + 求三连关注

【弹幕互动引导】

  • "觉得有用的扣 1"
  • "不同观点的弹幕见"
  • 结尾设置投票:你看好这个方向吗?A.看好 B.观望 C.不看好

🏷️ 标签:#开源AI, #LLM部署, #云计算

🎬 抖音口播脚本 | 时长:45-60秒

【0-5秒 黄金Hook】

别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

【5-35秒 核心信息(口语化表达,每句一行)】

别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。 就在上周,我的一位朋友还在为调用GPT-4 API的账单发愁——一个月下来,光测试对话就烧掉了上百美元。他问我:“有没有更便宜的办法?” 答案是肯定的,而且比大多数人想象的要简单得多。今天,我们要聊的不是什么高深

【35-50秒 深度扩展】

月付5美元,10分钟搞定:我把Llama 2塞进了廉价云服务器

【50-60秒 强CTO结尾】

觉得有用的话,双击点赞 + 关注,下期继续带你读懂 AI!🔥


📐 拍摄建议:竖屏 9:16 · 科技感电子背景乐 · 关键数据配文字弹幕 · 表情自然语速适中

月付5美元,10分钟搞定:我把Llama 2塞进了廉价云服务器

【导语】 别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。
本文目录:

1. 为什么“自托管”突然成了香饽饽?

2. 硬件够吗?别被“大模型”三个字吓到

3. 实战:10分钟部署指南

4. 性能实测:够用吗?

5. 省钱策略:5美元方案的真实成本


别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

就在上周,我的一位朋友还在为调用GPT-4 API的账单发愁——一个月下来,光测试对话就烧掉了上百美元。他问我:“有没有更便宜的办法?”

答案是肯定的,而且比大多数人想象的要简单得多。今天,我们要聊的不是什么高深莫测的技术,而是一个朴素得近乎“土气”的方案:在月租5美元的DigitalOcean服务器上,自己托管Meta开源的Llama 2模型。整个过程,10分钟搞定。

为什么“自托管”突然成了香饽饽?

先来看一组数据。OpenAI的GPT-4定价为每千个输入token 0.03美元,Anthropic的Claude是0.008美元。听起来不多?但如果你需要处理大量文本、做批量推理、或者构建一个日活过万的AI应用,这笔费用会像滚雪球一样膨胀。

更关键的问题在于:你依赖的API随时可能涨价、限流,甚至因为服务商的政策调整而一夜之间变得不可用。自托管开源模型,意味着你拿回了数据主权和成本控制权

Llama 2是Meta于2023年7月发布的开源大语言模型,包含70亿、130亿和700亿参数三种规格。其中7B版本在量化后,对硬件的要求低得惊人——这正是它在廉价云服务器上运行的基础。

硬件够吗?别被“大模型”三个字吓到

很多人一听到“大语言模型”,脑海中浮现的是英伟达A100集群。但实际上,Llama 2 7B在4-bit量化后,模型大小仅为3.5GB左右,推理时的内存占用可以控制在5GB以内。

DigitalOcean最便宜的Droplet配置是1核CPU、1GB内存、25GB SSD。坦白说,这个配置跑Llama 2会很吃力——但别忘了,DigitalOcean每月5美元只是起点。实际上,我推荐至少选择2GB内存的配置(大约12美元/月),或者使用其他提供类似优惠的云服务商。

等等,这篇文章的标题不是说5美元吗?别急,下面我会讲到如何优化。

实战:10分钟部署指南

第一步:创建Droplet

登录DigitalOcean控制台,创建一个Ubuntu 22.04的Droplet。选择2GB/1核的配置(约12美元/月),或者如果你真的想挑战极限,1GB内存也不是完全不行——只是会频繁触发Swap。

第二步:安装依赖

SSH登录服务器后,依次执行:

apt update && apt install -y python3-pip git
pip3 install llama-cpp-python

这里我们使用llama-cpp-python,它是llama.cpp的Python绑定。llama.cpp是Georgi Gerganov开发的高性能推理库,专为在CPU上运行量化模型而优化——这让我们完全绕开了GPU的昂贵成本

第三步:下载量化模型

Hugging Face上有大量Llama 2的GGUF量化版本(GGUF是llama.cpp的模型格式)。以TheBloke的Llama-2-7B-Chat-GGUF为例:

wget https://huggingface.co/TheBloke/Llama-2-7B-Chat-GGUF/resolve/main/llama-2-7b-chat.Q4_K_M.gguf

这个文件大约3.8GB,下载可能需要几分钟。

第四步:启动推理服务

from llama_cpp import Llama

llm = Llama(model_path="./llama-2-7b-chat.Q4_K_M.gguf", n_ctx=2048)

output = llm(
    "Q: 什么是机器学习?A:",
    max_tokens=256,
    temperature=0.7,
    echo=True
)

print(output["choices"][0]["text"])

如果你想要一个HTTP API服务,可以使用llama-cpp-python自带的服务器:

python3 -m llama_cpp.server --model ./llama-2-7b-chat.Q4_K_M.gguf --n_ctx 2048

这样你就拥有了一个本地OpenAI兼容API,可以无缝替换GPT-4调用。

性能实测:够用吗?

在2GB内存的Droplet上,Llama 2 7B的推理速度大约为每秒3-5个token。这个速度对于实时聊天来说偏慢,但对于批量处理、异步任务或者对延迟不敏感的场景完全够用。

如果你愿意多花一点钱升级到4GB内存(约24美元/月),推理速度可以提升到每秒8-10个token,体验会流畅很多。

省钱策略:5美元方案的真实成本

现在回到标题的“5美元”问题。事实上,DigitalOcean的5美元/月配置(1GB内存)运行Llama 2 7B非常勉强,几乎必须依赖Swap分区,推理速度会降到每秒1-2个token。

但如果你换个思路——使用更小的模型呢? 比如Meta的Llama 2 3B(尚未发布)或者微软的Phi-2(27亿参数),在1GB内存上可以跑得不错。又或者,你可以使用更激进的量化(如Q2_K),牺牲一些质量来换取速度。

实际上,更聪明的做法是利用DigitalOcean的免费额度。新用户通常会获得200美元的赠送额度(参考文末链接),这意味着你可以在几个月内“免费”使用更高配置的服务器。

自托管的真正价值

省下的钱只是表面收益。自托管带来的深层价值包括:

1. 数据隐私:你的对话数据不会离开你的服务器

2. 无速率限制:没有每分钟调用次数上限

3. 完全控制:可以微调模型、修改推理参数

4. 离线可用:不依赖外部API的可用性

当然,代价是你需要自己处理运维——模型更新、安全补丁、性能调优。但这对于技术人员来说,恰恰是一种乐趣。

未来展望

随着Llama 3、Mistral等更高效的开源模型不断涌现,以及量化技术和推理引擎的持续优化,AI自托管的门槛正在急剧降低。也许在不久的将来,每个开发者都会在自己的笔记本电脑上运行一个私人AI助手,就像今天每个人都拥有一个本地数据库一样自然。

到那时,API提供商们可能需要重新思考他们的定价策略了——毕竟,当开源模型的能力追平闭源模型时,人们为什么还要为token付费呢?



关键词:#开源AI, #LLM部署, #云计算 声明:本文由彩虹洋葱 AI 智能聚合生成,仅供信息参考。

月付5美元,10分钟搞定:我把Llama 2塞进了廉价云服务器 🔥

别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。


别再给AI巨头交“智商税”了。当GPT-4每千token要价3美分时,一个价值5美元的DigitalOcean Droplet,正在让开源大模型成为精打细算的开发者们的新宠。

就在上周,我的一位朋友还在为调用GPT-4 API的账单发愁——一个月下来,光测试对话就烧掉了上百美元。他问我:“有没有更便宜的办法?”

答案是肯定的,而且比大多数人想象的要简单得多。今天,我们要聊的不是什么高深莫测的技术,而是一个朴素得近乎“土气”的方案:在月租5美元的DigitalOcean服务器上,自己托管Meta开源的Llama 2模型。整个过程,10分钟搞定。


📌 来源:Dev.to

##开源AI ##LLM部署 ##云计算

#科技资讯 #彩虹洋葱AI

🚀 多平台发布

点击「复制」获取平台专属文案,到各平台编辑器(App/网页)粘贴即可发布。
有密钥的 4 个平台(微信服务号 / 头条 / 百家号 / 微博)可自动发布,密钥填好后自动点亮。

平台状态操作
✍️ 简书📋 手动复制
快手📋 手动复制
🐦 微博🔑 待配置密钥
💻 CSDN📋 手动复制
⛏️ 掘金📋 手动复制
💬 公众号🔑 待配置密钥
📰 今日头条🔑 待配置密钥
🤔 知乎📋 手动复制
📺 B站📋 手动复制
🎵 抖音📋 手动复制
📝 百家号🔑 待配置密钥
📕 小红书📋 手动复制