统计、机器学习与编程知识的原创博客

★ 【置顶】推荐一个国内可以按分钟计费的4090显卡租用公有云，一个小时24GB显存的4090只需要2.37元——仙宫云

大模型的发展速度很快，对于需要学习部署使用大模型的人来说，显卡是一个必不可少的资源。使用公有云租用显卡对于初学者和技术验证来说成本很划算。DataLearnerAI在此推荐一个国内的合法的按分钟计费的4090显卡公有云服务提供商仙宫云，可以按分钟租用24GB显存的4090显卡公有云实例，非常具有吸引力~

4090显卡/仙宫云/显卡公有云/显卡租赁

检索增强生成（RAG）

大模型检索增强生成是一种结合了大规模语言模型的自动生成能力和针对特定数据的检索机制，以提供更准确、信息丰富的输出内容的技术。

查看RAG合集

Long Context

大模型对长上下文的处理能力在于它们能够理解和维持较长篇幅的文本连贯性，有助于提升质量，以及对复杂问题和讨论的理解和回应质量。

LongContext合集

AI Agent

大模型的AI Agent是一种高级智能系统，能够理解复杂的指令和查询，并以人类般的方式生成响应、执行任务或提供决策支持。

AI Agent合集

Seq2Seq的建模解释和Keras中Simple RNN Cell的计算及其代码示例

RNN的应用有很多，尤其是两个RNN组成的Seq2Seq结构，在时序预测、自然语言处理等方面有很大的用处，而每个RNN中一个节点是一个Cell，它是RNN中的基本结构。本文从如何使用RNN建模数据开始，重点解释RNN中Cell的结构，以及Keras中Cell相关的输入输出及其维度。我已经尽量解释了每个变量，但可能也有忽略，因此可能对RNN之前有一定了解的人会更友好，本文最主要的目的是描述Keras中RNNcell的参数以及输入输出的两个注意点。如有问题也欢迎指出，我会进行修改。

2020/07/12 21:25:13

3859

Keras/RNN/Seq2Seq/SimpleRNNCell/深度学习

OpenAI最新的GPT-4V的多模态API接口是如何计算tokens的？这些计算逻辑背后透露了GPT-4V什么样的模型架构信息？

OpenAI在发布了多模态的GPT-4V（GPT-4 with Vision）的接口，可以实现图像理解的功能（`Image-to-Text`）。这是OpenAI的第一个多模态接口，在以前的接口中，OpenAI都是文本大模型，相关的费用计算都是按照输入输出的tokens计算，虽然与一个单词多少钱有一点差异，但是也算直观。而GPT-4V是一个图像理解的接口，这里的费用计算不像文本的tokens那么直观，那么这个接口的费用计算逻辑是什么？这个计算逻辑透露了什么样的模型架构信息？本文将介绍这个问题。

2023/11/07 16:10:24

3865

gpt-4-vision-preview/gpt-4-vision-preview费用计算/GPT-4V

Author Topic Model[ATM理解及公式推导]

2017-01-13 11:38:43

3876

Gibbs抽样/TopicModel

Python报Memory Error或者是numpy报ValueError: array is too big; `arr.size * arr.dtype.itemsize` 的解决方法

有的时候使用Python遇到内存溢出的问题，但其实机器剩余内存很多。需要注意Python版本是否正确

2021/06/07 22:19:11

3877

python/编程

深度学习的反向传播手动推导

反向传播算法是深度学习求解最重要的方法。这里我们手动推导一下。

2019/06/04 11:37:14

3892

反向传播/梯度下降/深度学习

NumPy新版本发布了~~1.20.0横空出世

NumPy是Python中非常优秀的一个数据科学工具包，使用Python做数据分析的童鞋几乎是必备的工具。NumPy的提供了非常丰富的计算能力，但是底层是C语言实现的，因此既有Python语法的低门槛，速度上却依然非常好。NumPy本身也和Pandas、SciPy一起成为一种生态了。今天，NumPy发布了1.20.0最新版本，这个版本的改动很大。值得童鞋们关注~

2021/01/31 16:31:21

3896

numpy/python

Linux环境下使用NLPIR(ICTCLAS)中文分词详解

linux环境下使用中文分词工具

2017-01-02 20:54:51

3916

linux/NLPIR

pip、Anaconda更改国内源以及为当前用户安装

如何更改国内源，提升下载速度，以及只为当前用户安装指定包

2018/05/31 11:16:15

3931

pip

500+个优质的ChatGPT的Prompts（模板）

随着ChatGPT的火爆，Prompts概念开始被大家所熟知。早期类似如BERT模型的微调都是通过有监督学习的方式进行。但是随着模型越来越大，冻结大部分参数，根据下游任务做微调对模型的影响越来越小。大家开始发现，让下游任务适应预训练模型的训练结果有更好的性能。而ChatGPT的火爆让大家知道，虽然ChatGPT的能力很强，但是需要很好的提问方式才能让它为你所服务。

2023/03/10 23:09:09

3965

ChatGPT/Prompts/提问模板

一文总结13个国内外ChatGPT平替产品：是时候可以不那么依赖ChatGPT了~

ChatGPT是最近半年多全球最火的产品。去年11月底发布之后，ChatGPT仅仅2个月时间就收获了1亿的月活。尽管在前几个月，ChatGPT是一枝独秀的存在，几乎没有任何可以与其竞争的产品与服务。然而在2023年7月份快结束的今天，市场上已经有相当多优秀的产品可供大家使用。

2023/07/23 22:41:01

3968

ChatGPT/在线聊天机器人

JetBrains的IDEA打包可执行Jar文件以及maven的依赖的方法

使用idea打包jar文件的方法

2018/05/01 16:22:51

3981

idea/java/编程

好消息~Kaggle提高了免费的GPU和内存等计算资源的使用额度！

Kaggle是机器学习竞赛平台当之无愧的老大，除了提供了平台让企业和研究机构发布机器学习相关竞赛来让大家竞技和交流以外，他们还提供了免费的编程平台让大家使用免费的GPU和内存来训练模型和测试模型效果。而昨天，Kaggle升级了这些免费资源服务。

2022/10/20 21:50:41

4011

GPU/kaggle/免费GPU

OpenAI开源GPT-2的子词标记化神器——tiktoken，一个超级快的（Byte Pair Encoder，BPE）字节对编码Python库

OpenAI在其官方GitHub上公开了一个最新的开源Python库：tiktoken，这个库主要是用力做字节对编码的。相比较HuggingFace的tokenizer，其速度提升了好几倍。

2022/12/16 21:11:16

4026

OpenAI/tokenizer/开源

Let's Encrypt的Certbot自动生成证书和自动更新证书

网站启用HTTPS必须制作证书，而证书的制作需要定期更新。这里介绍了Certbot证书自动生成工具和自动更新的方法。并描述了Tomcat如何配置pem证书。

2020/06/06 21:34:41

4044

编程/网站

最强SQL代码生成开源大模型发布：DefogAI开源超过gpt-3.5-turbo的SQL生成大模型SQLCoder，免费商用授权~

SQLCoder 是 Defog 团队推出的一款前沿的语言模型，专门用于将自然语言问题转化为 SQL 查询。这是一个拥有150亿参数的模型，其性能略微超过了 gpt-3.5-turbo 在自然语言到 SQL 生成任务上，并且显著地超越了所有流行的开源模型。更令人震惊的是，尽管 SQLCoder 的大小只有 text-davinci-003 的十分之一，但其性能却远超后者。

2023/08/22 11:22:41

4056

SQLCoder/编程大模型