人工智能与大模型最新资讯与技术博客

★ 【置顶】推荐一个国内可以按分钟计费的4090显卡租用公有云，一个小时24GB显存的4090只需要2.37元——仙宫云

大模型的发展速度很快，对于需要学习部署使用大模型的人来说，显卡是一个必不可少的资源。使用公有云租用显卡对于初学者和技术验证来说成本很划算。DataLearnerAI在此推荐一个国内的合法的按分钟计费的4090显卡公有云服务提供商仙宫云，可以按分钟租用24GB显存的4090显卡公有云实例，非常具有吸引力~

4090显卡/仙宫云/显卡公有云/显卡租赁

检索增强生成（RAG）

大模型检索增强生成是一种结合了大规模语言模型的自动生成能力和针对特定数据的检索机制，以提供更准确、信息丰富的输出内容的技术。

查看RAG合集

Long Context

大模型对长上下文的处理能力在于它们能够理解和维持较长篇幅的文本连贯性，有助于提升质量，以及对复杂问题和讨论的理解和回应质量。

LongContext合集

AI Agent

大模型的AI Agent是一种高级智能系统，能够理解复杂的指令和查询，并以人类般的方式生成响应、执行任务或提供决策支持。

AI Agent合集

6张示意图解释6种语言模型（Language Transformer）使用方式

近几年语言模型的发展速度很快，各种大语言预训练模型的推出让算法在各种NLP的任务中都取得了前所未有的成绩。其中2017年谷歌发布的Attention is All You Need论文将transformer架构推向了世界，这也是现在最流行的语言模型结构。威斯康星大学麦迪逊分校的统计学教授Sebastian Raschka总结了6中Language Transformer的使用方法。值得一看。

2022/11/06 11:56:31

1504

transformer/预训练模型

好东西！Transformer入门神作手把手按行实现Transformer教程The Annotated Transformer2022版本来袭

The Annotated Transfomer是哈佛大学的研究人员于2018年发布的Transformer新手入门教程。这个教程从最基础的理论开始，手把手教你按照最简单的python代码实现Transformer，一经推出就广受好评。2022年，这个入门教程有了新的版本。

2022/11/05 20:02:14

1792

transformer/教程

一张图看清楚HTML语法的结构和名称

2022/11/05 19:38:35

625

HTML

Batch Normalization应该在激活函数之前使用还是激活函数之后使用？

Batch Normalization（BN）是深度学习领域最重要的技巧之一，最早由Google的研究人员提出。这个技术可以大大提高深度学习网络的收敛速度。简单来说，BN就是将每一层网络进行归一化，就可以提高整个网络的训练速度，并打乱训练数据，提升精度。但是，BN的使用可以在很多地方，很多人最大的困惑是放在激活函数之前还是激活函数之后使用，著名机器学习领域的博主Santiago总结了这部分需要注意的内容。

2022/11/05 14:42:33

2374

BatchNormalization/深度学习/激活函数

好消息~Kaggle提高了免费的GPU和内存等计算资源的使用额度！

Kaggle是机器学习竞赛平台当之无愧的老大，除了提供了平台让企业和研究机构发布机器学习相关竞赛来让大家竞技和交流以外，他们还提供了免费的编程平台让大家使用免费的GPU和内存来训练模型和测试模型效果。而昨天，Kaggle升级了这些免费资源服务。

2022/10/20 21:50:41

4086

GPU/kaggle/免费GPU

重磅！Scikit-learn与Hugging Face强强联手了！

Hugging Face一直在努力支持深度学习，但是，这只是深度学习的一部分。传统统计机器学习领域里面最重要的工具Scikit-learn如今终于和深度学习的开源标杆工具Hugging Face联手。

2022/10/18 23:36:35

815

HuggingFace/sklearn/transformers

Kaggle 2022调查报告出炉！看看过去一年数据科学家都在干啥！

kaggle是各类机器学习竞赛的著名平台，上面聚集了大量的机器学习比赛和数据集，也有大量的数据处理相关专业人员。每年官方都会向平台用户发放问卷，调查数据科学家的工具使用和平台采用情况。今年的调查结果也在两天前发出，有很多有意思的结论。

2022/10/13 14:54:10

1216

kaggle

最高50万美金！全新高额奖金的AI竞赛——AI预测大赛

预测在全球决策中发挥着关键作用。例如，关于COVID-19扩散的预测为国家封锁提供了信息，而经济预测则影响了利率的制定。这些预测通常依赖于人类专家的仔细判断，他们必须考虑来自各种来源的数据。由于人工智能系统能够处理大量的数据，它们在这个领域有可能非常有用。为此，ML Safety举办了一个关于AI预测的竞赛，比赛的目的是建立一个机器学习模型，做出准确和校准的预测。

2022/10/12 11:37:36

852

竞赛

扩散模型是如何工作的：从0开始的数学原理——How diffusion models work: the math from scratch

随着DALL·E2的发布，大家发现Text-to-Image居然可以取得如此好的效果。也让diffusion模型变得非常受欢迎。扩散模型虽然火热，但是背后的数学原理可能很多人也不太了解。这篇博客不仅介绍了扩散模型背后的数学原理，也讲述了如何训练扩散模型以及提高扩散模型训练效率的种种技巧，十分值得大家钻研。

2022/10/05 17:46:24

7861

DALLE/StableDiffusion/扩散模型

12倍推理速度提升！Meta AI开源全新的AI推理引擎AITemplate

为了提高AI模型的推理速度，降低在不同GPU硬件部署的成本，Meta AI研究人员在昨天发布了一个全新的AI推理引擎AITemplate（AIT），该引擎是一个Python框架，它在各种广泛使用的人工智能模型（如卷积神经网络、变换器和扩散器）上提供接近硬件原生的Tensor Core（英伟达GPU）和Matrix Core（AMD GPU）性能。

2022/10/04 13:28:27

2466

AITemplate/AI推理速度/PyTorch