标签为 #爬虫# 的博客 | 数据学习(Datalearner)

★ 【置顶】推荐一个国内可以按分钟计费的4090显卡租用公有云，一个小时24GB显存的4090只需要2.37元——仙宫云

大模型的发展速度很快，对于需要学习部署使用大模型的人来说，显卡是一个必不可少的资源。使用公有云租用显卡对于初学者和技术验证来说成本很划算。DataLearnerAI在此推荐一个国内的合法的按分钟计费的4090显卡公有云服务提供商仙宫云，可以按分钟租用24GB显存的4090显卡公有云实例，非常具有吸引力~

4090显卡/仙宫云/显卡公有云/显卡租赁

Card image cap

检索增强生成（RAG）

大模型检索增强生成是一种结合了大规模语言模型的自动生成能力和针对特定数据的检索机制，以提供更准确、信息丰富的输出内容的技术。

查看RAG合集

Card image cap

Long Context

大模型对长上下文的处理能力在于它们能够理解和维持较长篇幅的文本连贯性，有助于提升质量，以及对复杂问题和讨论的理解和回应质量。

LongContext合集

Card image cap

AI Agent

大模型的AI Agent是一种高级智能系统，能够理解复杂的指令和查询，并以人类般的方式生成响应、执行任务或提供决策支持。

AI Agent合集

Java爬虫入门简介（一） —— HttpClient请求

Java爬虫入门简介（一） —— HttpClient请求

使用爬虫获取数据对科研来说及其重要，本系列博客将讲述如何使用Java编写爬虫工具获取网页数据。包括HttpClient 4.3及以上版本的Header设置，请求参数设置等。

2017/11/08 15:24:56

6901

HttpClient/Java/爬虫

Java爬虫入门简介（三） —— Jsoup解析HTML页面

Java爬虫入门简介（三） —— Jsoup解析HTML页面

使用爬虫获取数据对科研来说及其重要，本系列博客将讲述如何使用Java编写爬虫工具获取网页数据。在这篇博客里，我们将简单介绍Jsoup解析HTML页面的操作。

2017/11/08 11:16:51

4858

HttpClient/Java/Jsoup/爬虫

Java爬虫入门简介（二） —— HttpClient详细使用方法

Java爬虫入门简介（二） —— HttpClient详细使用方法

使用爬虫获取数据对科研来说及其重要，本系列博客将讲述如何使用Java编写爬虫工具获取网页数据。包括HttpClient 4.3及以上版本的Header设置，请求参数设置等。

2017/11/08 11:16:43

4137

HttpClient/爬虫

Java爬虫入门简介（四）——HttpClient保存使用Cookie登录

Java爬虫入门简介（四）——HttpClient保存使用Cookie登录

在使用HttpClient作为客户端请求数据的时候，我们常常需要以一个用户的身份多次请求一个网站内的多种资源。例如，我一次登录后，后面希望以这个身份继续访问不用重新登录。这里就可以使用cookie了。

2017/11/08 11:16:09

6890

Cookie/HttpClient/爬虫

Java爬虫入门简介（五）——抓包工具的使用以及使用HttpClient模拟用户登录的访问

Java爬虫入门简介（五）——抓包工具的使用以及使用HttpClient模拟用户登录的访问

网络爬虫需要解决的一个重要的问题就是要针对某些需要用户名和密码访问的页面可以模拟用户自动登录。在这一篇博客中我们将介绍如何使用Chrome浏览器自带的抓包工具分析页面并模拟用户自动登录

2017/11/04 09:28:53

7187

HttpClient/Java/爬虫

爬虫聚焦——以新浪微博为例

学爬虫先学思想，思想掌握了，对应代码学习技术就so easy了~

2017/03/29 17:35:12

4464

思想/技术/爬虫

网络爬虫中URLConnection的使用[以科学网为例]

网络爬虫中URLConnection的使用[以科学网为例]

2017/02/23 10:32:00

2453

网络爬虫

Java多线程网络爬虫(时光网为例)

Java多线程网络爬虫(时光网为例)

Java多线程网络爬虫(时光网为例)

2016-09-26 08:27:06

3382

Java/网络爬虫

Scrapy网络爬虫实战[保存为Json文件及存储到mysql数据库]

Scrapy网络爬虫实战[保存为Json文件及存储到mysql数据库]

Scrapy网络爬虫实战[保存为Json文件及存储到mysql数据库]

2016-09-18 16:09:09

6192

python/网络爬虫框架

python中Scrapy的安装详细过程

python中Scrapy的安装详细过程

python中Scrapy的安装详细过程

2016-09-18 08:34:00

2920

python/网络爬虫

python中Scrapy的安装详细过程

python中Scrapy的安装详细过程

python中Scrapy的安装详细过程

2016-09-18 08:30:30

2648

python/网络爬虫

网络爬虫模拟登陆获取数据并解析实战（二）

网络爬虫模拟登陆获取数据并解析实战（二）

网络爬虫模拟登陆获取数据并解析实战

2016-09-09 08:33:54

3115

java/网络爬虫

基于java的网络爬虫框架(实现京东数据的爬取，并将插入数据库)

基于java的网络爬虫框架(实现京东数据的爬取，并将插入数据库)

基于java的网络爬虫框架

2016-09-09 08:32:12

2836

java/网络爬虫

网络爬虫中的模拟登陆获取数据（实例教学）

网络爬虫中的模拟登陆获取数据（实例教学）

网络爬虫中的模拟登陆获取数据

2016-09-09 08:30:35

2899

java/模拟登陆/网络爬虫

网络爬虫中Json数据的解析

网络爬虫中Json数据的解析

2016-09-09 08:29:17

3463

java/json/网络爬虫

今日推荐

网络爬虫之基础java集合操作篇

MetaAI开源高质量高精度标注的图像数据集FACET：3.2万张图片、5万个主题，平均图像解析度达到1500×2000

OpenAI发布企业使用的ChatGPT：没有限制且更快的GPT-4、数据隔离、基于GPT-4的高级数据分析功能，但是暂不支持私有化部署

OpenAI官方Prompt教程：如何让ChatGPT扮演不同角色，完成教学任务

分解机（Factorization Machine, FM）模型简介以及如何使用SGD、ALS和MCMC求解分解机

内容生成方向的人工智能企业

Google发布第二代Gemini大语言模型，首个登场的Gemini 2 Flash Experimental，评测结果显示其能力已经超越上一代的Gemini 1.5 Pro！

线性数据结构之跳跃列表（Skip List）详解及其Java实现

预训练大语言模型的三种微调技术总结：fine-tuning、parameter-efficient fine-tuning和prompt-tuning

智谱AI发布第二代CodeGeeX编程大模型：CodeGeeX2-6B，最低6GB显存可运行，基于ChatGLM2-6B微调

最热博客

Dirichlet Distribution（狄利克雷分布）与Dirichlet Process（狄利克雷过程）

回归模型中的交互项简介（Interactions in Regression）

贝塔分布（Beta Distribution）简介及其应用

矩母函数简介（Moment-generating function）

普通最小二乘法（Ordinary Least Squares，OLS）的详细推导过程

使用R语言进行K-means聚类并分析结果

深度学习技巧之Early Stopping（早停法）

H5文件简介和使用

手把手教你本地部署清华大学的ChatGLM-6B模型——Windows+6GB显卡本地部署

Wishart分布简介