统计、机器学习与编程知识的原创博客

★ 【置顶】推荐一个国内可以按分钟计费的4090显卡租用公有云，一个小时24GB显存的4090只需要2.37元——仙宫云

大模型的发展速度很快，对于需要学习部署使用大模型的人来说，显卡是一个必不可少的资源。使用公有云租用显卡对于初学者和技术验证来说成本很划算。DataLearnerAI在此推荐一个国内的合法的按分钟计费的4090显卡公有云服务提供商仙宫云，可以按分钟租用24GB显存的4090显卡公有云实例，非常具有吸引力~

4090显卡/仙宫云/显卡公有云/显卡租赁

检索增强生成（RAG）

大模型检索增强生成是一种结合了大规模语言模型的自动生成能力和针对特定数据的检索机制，以提供更准确、信息丰富的输出内容的技术。

查看RAG合集

Long Context

大模型对长上下文的处理能力在于它们能够理解和维持较长篇幅的文本连贯性，有助于提升质量，以及对复杂问题和讨论的理解和回应质量。

LongContext合集

AI Agent

大模型的AI Agent是一种高级智能系统，能够理解复杂的指令和查询，并以人类般的方式生成响应、执行任务或提供决策支持。

AI Agent合集

BPR：面向隐式反馈数据的贝叶斯个性化排序

本文是Steffen Rendle的文章BPR: Bayesian Personalized Ranking from Implicit Feedback的译文

2016-05-08 10:05:48

4622

BPR/排序模型/译文/隐式反馈

Java类型转换中valueOf方法和parseInt方法的区别

在Java的类型转换中，我们经常会使用valueOf或者parseInt（parseFloat/parseDouble等）来转换。这二者有什么区别呢？这里简要介绍一下。

2019/08/17 17:13:26

4609

Java/编程

ChatGLM-6B升级！清华大学开源VisualGLM-6B：一个可以在本地运行的读懂图片的语言模型！

今天，THUDM开源了ChatGLM-6B的多模态升级版模型VisualGLM-6B。这是一个多模态对话语言模型，支持图像、中文和英文。VisualGLM-6B的特别之处在于它能够整合视觉和语言信息。可以用来理解图片，解析图片内容。

2023/05/19 00:27:34

4605

ChatGLM-6B/VisualGLM-6B/图片理解/多模态模型

Spark源码分析之RDD下的KMeans

这篇博客主要介绍Spark源码中的KMeans部分，说的是RDD下的KMeans源码

2018/09/26 15:22:24

4563

scala/spark/大数据

HFUTUtils的使用

HFUTUtils是一个工具程序集合，方便我们平时处理数据。针对文本处理的内容较多。使用起来非常简单。是本人平时使用Java处理数据时候写的工具，方便数据预处理的。

2017/05/31 19:52:20

4511

HFUTUtils/java

beta分布的采样或抽样(java程序)

beta分布采样

2017/05/12 15:47:04

4510

beta分布采样

推荐一个国内可以按分钟计费的4090显卡租用公有云，一个小时24GB显存的4090只需要2.37元——仙宫云

爬虫聚焦——以新浪微博为例

学爬虫先学思想，思想掌握了，对应代码学习技术就so easy了~

2017/03/29 17:35:12

4467

思想/技术/爬虫

Android开发入门基础

Android是基于Linux的修改版本的移动操作系统。大多数Android代码是在开源Apache许可证下发布的。本文将简单介绍Android开发入门知识。

2017/11/08 11:16:37

4448

Android/移动编程/编程

大规模中文开源数据集发布！2TB、几十亿条可商用的中文数据集书生·万卷 1.0开源~中文大模型能力可能要更上一层楼了！

随着近年来GPT-3、ChatGPT等大模型的兴起，高质量的数据集在模型训练中扮演着越来越重要的角色。但是当前领先的预训练模型使用的数据集细节往往不公开，开源数据的匮乏制约着研究社区的进一步发展。特别是大规模中文数据集十分缺乏，对中文大模型以及业界模型的中文支持都有很大的影响。此次，上海人工智能实验室发布的这个数据集包含了丰富的中文，对于大模型的中文能力提升十分有价值。

2023/08/24 16:39:22

4437

中文预训练数据集/大模型数据集/开源数据集

平衡二叉树之AVL树（Adelson-Velsky and Landis Tree）简介及Java实现

在前面的内容中，我们已经介绍了平衡二叉树。其中提到了AVL树，这是一种非常著名的平衡二叉树。这是第一个发明类似自平衡机制的二叉树数据结构。在AVL树中，任何节点的两个子树的高度最多相差一个。如果在任何时候它们相差多于一个，则重新平衡以恢复此属性。

2018/10/27 09:30:01

4423

二叉树/数据结构/自平衡二叉树

各大企业和机构拥有的NVIDIA A100的GPU显卡数量

Stateof.AI上周发布了最新的AI的报告中报告了当前各大企业和机构拥有的NVIDIA A100的GPU数量。A100是目前商用的最强大的GPU，对于超级计算机、大规模AI模型的训练和推理来说都十分重要。这里透露的各大企业的GPU数量也让我们可以看到各家的竞争情况。

2023/09/08 20:19:06

4384

A100/GPU/洞察报告

基于PITF模型的个性化标签推荐

本文是Steffen Rendle的Pairwise Interaction Tensor Factorization for Personalized Tag Recommendation的译文。

2016-05-08 11:09:47

4364

PITF/张量分解/推荐/标签/译文

在线广告的紧凑分配方案（Optimal Online Assignment with Forecasts）

广告分配问题属于运筹中的优化问题。一般情况下，我们期望有个最大化收益，但同时需要保证合约的完成。因此，这是一个带不等式约束的最优化问题。由于广告数量和用户数量很多，因此，求解的难度很高。在这篇文章中，作者推导了原问题的拉格朗日函数的系数之间的关系，大大降低了求解的难度。这里将简要介绍原理和推导过程。

2019/02/28 15:59:05

4358

在线广告/展示广告/广告分配