统计、机器学习与编程知识的原创博客

★ 【置顶】推荐一个国内可以按分钟计费的4090显卡租用公有云，一个小时24GB显存的4090只需要2.37元——仙宫云

大模型的发展速度很快，对于需要学习部署使用大模型的人来说，显卡是一个必不可少的资源。使用公有云租用显卡对于初学者和技术验证来说成本很划算。DataLearnerAI在此推荐一个国内的合法的按分钟计费的4090显卡公有云服务提供商仙宫云，可以按分钟租用24GB显存的4090显卡公有云实例，非常具有吸引力~

4090显卡/仙宫云/显卡公有云/显卡租赁

检索增强生成（RAG）

大模型检索增强生成是一种结合了大规模语言模型的自动生成能力和针对特定数据的检索机制，以提供更准确、信息丰富的输出内容的技术。

查看RAG合集

Long Context

大模型对长上下文的处理能力在于它们能够理解和维持较长篇幅的文本连贯性，有助于提升质量，以及对复杂问题和讨论的理解和回应质量。

LongContext合集

AI Agent

大模型的AI Agent是一种高级智能系统，能够理解复杂的指令和查询，并以人类般的方式生成响应、执行任务或提供决策支持。

AI Agent合集

ChatGPT颠覆更新！即将发布的ChatGPT新版本带来巨变，新界面和可以自定义GPT-4功能：可以对接私有数据与私有接口的个性化ChatGPT即将到来！

ChatGPT是当前大模型服务最前沿和风向标，每一次改动都会引起巨大的关注。此前，在ChatGPT的js脚本中就隐藏了即将发布的ChatGPT Team计划。而现在，新的ChatGPT UI代码和功能也被发现。新的GPT除了界面的巨大变化外，还有一个类似自定义AI Agent能力，可以直接接入自己的私有数据和API接口对外提供服务！十分震惊！

2023/11/03 15:28:17

1954

ChatGPT/GPT对接接口/GPT对接私有数据/GPT自定义/MagicMaker/新版本ChatGPT

重磅！MLPerf™训练1.1成绩发布！AI训练正在超越摩尔定律！

MLPerf™是MLCommons发布的一个用来测试AI相关软硬件性能的基准测试工具。2021年12月1日， Training v1.1的结果发布，这个结果不仅展示了最新的AI相关软硬件的进展，也有一个新的现象，就是AI训练正在超越摩尔定律。本文将简要解读一下相关数据。

2021/12/05 21:45:53

1950

AI测试/MLPerf

OpenAI再度泄露重磅更新，GPT-4即将发布128K的超长上下文版本以及多模态版本，价格下降一大半！

就在刚刚，有网友发现OpenAI的官方的文档接口更新中增加了128K的超长上下文版本，命名为GPT-4-128K-Turbo！

2023/11/06 17:27:48

1944

GPT-4/GPT-4-128K/GPT-4-128K-Turbo

DeepSeekAI开源国产第一个基于混合专家技术的大模型：DeepSeekMoE-16B，未来还有1450亿参数的MoE大模型

混合专家（Mixture of Experts）是大模型一种技术，这个技术将大模型划分为不同的子专家模型，每次推理只选择部分专家网络进行推理，在降低成本的同时保证模型的效果。此前Mistral开源的Mixtral-8×7B-MoE大模型被证明效果很好，推理速度很棒。而幻方量化旗下的DeepSeek刚刚开源了可能是国产第一个MoE技术的大模型，DeepSeek-MoE 16B。

2024/01/11 15:04:10

1913

DeepSeek/DeepSeekMoE/MoE/混合专家

input标签

2018/09/30 22:11:27

1910

input

Google发布面试辅助工具Interview Warmup帮助我们理解谷歌面试内容

最近，谷歌发布了一项新的工具：Google Interview Warmup，让你练习回答由行业专家选定的问题，并使用机器学习来转录你的答案，帮助你发现改进面试的回答。

2022/09/24 21:36:33

1906

谷歌/面试

ChatGPT官方代码解释器插件Code-Interpreter大揭秘：Code-Interpreter背后都有什么（执行环境、硬件资源、包含的Python库等）？

Code Interpreter是ChatGPT官方提供的一个插件。使用这个插件之后，ChatGPT可以通过生成Python代码来解决你的问题。在上周，Code Interperter已经完全开放给所有的付费用户，在大家使用了一段时间之后，已经有很多人通过机智的prompt来获取了Code Interpreter背后的执行环境和系统prompt信息等。本文针对这些获取的信息做一个总结，供大家参考。

2023/07/12 22:56:48

1901

ChatGPT/CodeInterpreter/GPT-4

重磅！阿里巴巴开源自家首个MoE技术大模型：Qwen1.5-MoE-A2.7B，性能约等于70亿参数规模的大模型Mistral-7B

阿里巴巴的通义千问一直是开源领域最强大的大模型之一。就在今天，阿里巴巴首次开源了他们家的MoE技术大模型Qwen1.5-MoE-A2.7B，这个模型是使用现有的Qwen-1.8B模型作为起点，通过类似merge技术进行合并得到的。

2024/03/29 00:40:06

1901

MoE/Qwen1.5-MoE/混合专家大模型/通义千问

关于padding

2018/10/08 21:16:21

1893

关于padding

使用LangChain做大模型开发的一些问题：来自Hacker News的激烈讨论~

LangChain是当前大模型应用开发领域里面最火热的框架。由于其提供了丰富的数据访问接口、各种大模型的交互接口以及很多构造大模型应用所需要的方法与实践工具，受到了很多人的关注。然而，今天Hacker News上的一位开发者直接提出LangChain是一个无用的框架，引起了很多人的共鸣。很多人都表示，在实际开发中，LangChain有很多问题，可能并不适合用来做大模型应用开发。

2023/07/09 23:15:29

1881

LangChain/LLM应用开发

Git提交本地文件

Git操作记录

2020/03/20 09:33:30

1877

git/svn/编程

最新OpenAI的API透露，ChatGPT Plus外还有升级版的订阅计划：ChatGPT Team！25美元一个月！Plus用户可能没有GPT-4-32K了！

ChatGPT是OpenAI提供的最强大的大模型服务。而截止目前为止，OpenAI公开的ChatGPT的订阅计划包含三个：免费版本的ChatGPT-3.5、个人用户付费订阅的ChatGPT Plus以及面向企业的企业版本。而最新的ChatGPT的API接口显示，OpenAI即将推出一个Team版本的计划，是当前ChatGPT Plus版本的升级版！

2023/11/03 15:23:31

1868

ChatGPT/ChatGPTTeam/ChatGPT订阅/OpenAI

关于border

2018/10/08 21:47:44

1866

关于border

让大模型支持更长的上下文的方法哪个更好？训练支持更长上下文的模型还是基于检索增强？

在大语言模型中，上下文长度是指模型可以考虑的输入数据的数量。更长的上下文在大语言模型的实际应用中有非常重要的价值。当前，让大语言模型支持更长的上下文有两种常用的方法，一种是训练支持更长上下文长度的模型，扩展模型的输入，另外一种是检索增强生成的方法（Retrieval Augmentation Generation，RAG）。但二者应该如何选择，这是一个很少能直接比较的问题。为此，英伟达（Nvidia）的研究人员做了一个详细的比较。

2023/10/10 15:28:48

1864

long-context/大语言模型/检索增强生成/长上下文