你希望导数(Derivative)是如何向你解释的?这是我的看法。
Psst!导数(Derivative)是微积分(Calculus)的核心,藏在这个定义里:
![]()
但这是什么意思?
假设我给你一份魔法报纸,上面列出了未来几年每天的股市变化(周一 +1%,周二 -2%……)。你能做什么?
嗯,你可以逐个应用这些变化,画出未来价格走势,低买高卖来建立你的帝国。你甚至可以不再用那些为你的投资组合随机选股票的猴子了。
就像这份魔法报纸,导数(Derivative)是一个水晶球,精确解释一个模式将如何变化。知道了这个,你可以绘制过去/现在/未来,找到最小值/最大值,从而做出更好的决策。这很有趣,比典型的“导数是函数的斜率”描述有意思多了。
让我们远离那个可怕的方程。方程的存在是为了传达思想:理解思想,而不是语法。
导数(Derivative)从一个不完美的猜测中创建出完美的变化模型。
这个成果来自数千年的思考,从阿基米德(Archimedes)到牛顿(Newton)。我们来看看背后的类比。
我们都生活在一个闪亮的连续统一体中
无穷(Infinity)是悖论(“头疼”)的持续来源:
- 一条线是由点构成的吗?当然。
- 那么一条线上有无限多个点?是的。
- 当有无穷多个点要访问时,你如何穿过一个房间?(哎呀,谢谢芝诺).
然而,我们确实在运动。我的直觉是用无穷对抗无穷。没错,0 到 1 之间有无限个点。但我以两个无穷(Infinity)点/秒(不知怎么做到的!)的速度运动,并在半秒内跨过了间隙。
距离有无限个点,运动成为可能,因此运动是用“每秒无穷多个点”来表述的。
与其思考差异(“到下一个点有多远?”),我们可以比较速率(“你穿越这个连续统一体的速度有多快?”)。
这很奇怪,但你可以把 10/5 看作“我需要在 5 段时间里穿越 10 个‘无穷’。为此,每单位时间我穿越 2 个‘无穷’”。
类比:把除法看作穿越连续统一体(continuum)中点的运动速率
零之后是什么?
另一个烧脑问题:零之后是什么数?0.01?0.0001?
嗯。无论你说什么数,我都能说更小的(我只要把你的数减半……略略略!)。
尽管我们无法计算写出零之后的那个数,但它一定存在,对吧?就像昔日的恶魔,它是“不可书写之数,违者必遭天谴”。
把这个到下一个数的间隔称为 $dx$。我不确定它到底多大,但它就在那里!
类比:dx 是连续统一体中跳到下一个数的“跳跃”。
测量结果取决于仪器
导数(Derivative)预测变化。好吧,我们如何衡量速度(距离的变化)?
警察:你知道你开多快吗?
司机:我完全不知道。
警察:每小时95英里。
司机:但我根本没开满一个小时!
我们显然不需要“整整一小时”来测速。我们可以取前后两次测量(比如间隔1秒)来得出你的瞬时速率(Instantaneous Rate)。如果你在1秒内移动了140英尺,那你大约就是95英里/时。很简单,对吧?
不全对。想象一台摄像机对着克拉克·肯特(超人的化身)。摄像机每秒拍24张照片(每张间隔40毫秒),克拉克看起来静止不动。按每秒来看,他没在动,速度是0英里/时。
又错了!在每张照片之间,那40毫秒里,克拉克变成了超人,破了案,又坐回椅子摆好姿势拍照。我们测出0英里/时,但他其实在动——他快得我们的仪器捕捉不到!
类比:就像看着 Superman 的摄像机,我们测到的速度取决于仪器!
在跑步机上奔跑
我们正接近导数(Derivative)那有嚼劲、微酸的核心。我们需要前后测量来侦测变化,但我们的测量可能有误。
想象一个光膀子的圣诞老人在跑步机上(去吧,我等你)。我们要在压力测试中测他的心率:给他贴几十个又重又冷的电极,让他跑起来。
圣诞老人呼哧呼哧喘着,心率飙到每分钟190次。那一定就是他“压力下”的心率,对吧?
不对。你看,严厉的科学家的存在和冰冷的电极本身就把他的心率抬高了!我们被测量190bpm,但要是没那些电极会测到什么谁知道呢!当然,没电极的话,我们也测不到了。
怎么办?嗯,看看这个系统:
- 测量值 = 实际数量 + 测量效应
啊。经过大量研究,我们可能发现“哦,每个电极让心率加10bpm”。我们做测量(不完美的190猜测),再去掉电极的影响(“完美估计”)。
类比:测量完成后去掉“电极效应”
顺便说,这种“电极效应”到处都是。研究有所霍桑效应当人们被关注时行为就变了因为它们正被研究。哎呀,似乎我们盯着的每个人都坚持节食了!
理解导数(Derivative)
有了这些见解,我们就能看透导数(Derivative)如何为变化建模:

从某个要研究的系统开始,$f(x)$:
- 以可能的最小量变化(dx)
- 得到变化前和变化后的差:f(x + dx) - f(x)
- 我们不知道 dx 到底有多小,也不关心:得到运动速率穿过连续统:[f(x + dx) - f(x)] / dx$
- 这个速率,无论多小,都有一些误差(我们的相机太慢了!)。预测如果测量是完美的、如果 dx 不存在会发生什么。
magic在最后一步:我们怎么去掉电极?我们有两种方法:
- 极限(Limit):当 dx 缩小到虚无、超出任何误差范围时会发生什么?
- 无穷小(Infinitesimal):如果 dx 是一个微小到在我们的数系中无法检测到的数呢?
两者都是把“不需要 $dx$ 时如何扔掉它?”这个想法形式化的方式。
我的槽点:极限(Limit)是现代的形式化工具,牛顿那时还没有。它们帮着让 $dx$ “干净地”消失。但在导数(Derivative)之前就教极限(Limit),就像先给方向盘却不给车!它是帮导数(Derivative)运作的工具,不是该孤立研究的对象。
一个例子:f(x) = x^2
我们用个例子抖掉脑子里的蛛网。函数(Function) $f(x) = x^2$ 在连续统中移动时如何变化?

注意最后两个方程的区别:
- 一个内建了误差(dx)
- 另一个有“真实”变化,其中 dx = 0(我们假设测量对结果没有影响)
来看实数。以下是 $f(x) = x^2$ 在 $dx = 1$ 间隔下的值:
- 1, 4, 9, 16, 25, 36, 49, 64...
每个结果之间的绝对变化是:
- 1, 3, 5, 7, 9, 11, 13, 15...
(这里,绝对变化是每个步骤之间的“速度”,其中间隔为 1)
考虑从 $x=2$ 到 $x=3$ 的跳跃($3^2 - 2^2 = 5$)。这个“5”是由什么组成的?
- 测得速率 = 实际速率 + 误差
- 5 = 2x + dx
- $5 = 2(2) + 1$
当然,我们测得了“每秒移动 5 个单位”的速度,因为我们在一个间隔内从 4 变到了 9。但我们的仪器骗了我们!其中 4 个单位的速度来自真实变化,1 个单位是由于仪器太差(1.0 是个很大的跳跃,不是吗?)。
如果我们局限于整数,5 就是从 4 到 9 的完美速度测量。假设 $dx = 1$ 没有“误差”,因为那就是相邻点之间的真实间隔。
但在现实世界中,每 1.0 秒测量一次太慢了。如果我们的 $dx$ 是 0.1 呢?在 $x=2$ 处我们会测到什么速度?
嗯,我们考察从 $x=2$ 到 $x=2.1$ 的变化:
- $2.1^2 - 2^2 = 0.41$
记住,0.41 是我们在 0.1 的间隔内发生的变化。我们的每单位速度是 0.41 / .1 = 4.1。再次得到:
- 测得速率 = 实际速率 + 误差
- 4.1 = 2x + dx
有趣。当 $dx=0.1$ 时,测得速率和真实速率很接近(4.1 对 4,2.5% 误差)。当 $dx=1$ 时,速率差别相当大(5 对 4,25% 误差)。
按照这个规律,我们发现扔掉电极(令 $dx=0$)就揭示了 $2x$ 的真实速率。
用大白话说:我们分析了 $f(x) = x^2$ 如何变化,找到了一个“不完美”的 $2x + dx$ 变化测量,并推导出“完美”的 $2x$ 变化模型。
作为“连续除法”的导数(Derivative)
我把积分(Integral)看作更好的乘法,你可以将变化的量施加到另一个量上。
导数(Derivative)是“更好的除法”,你在每一瞬间都能得到穿过连续体的速度。类似 10/5 = 2 表示“你在连续体中有恒定的速度 2”。
当你的速度在过程中变化时,你需要描述每一瞬间的速度。那就是导数(Derivative)。
如果你将这个变化的速度施加到每个瞬间(对导数求积分(Integral)),你就重建了原始行为,就像把每日股市变化施加回去以重建完整价格历史。但这是改天再讲的大话题。
注意:"Derivative" 的多种含义
你会在很多语境中看到“导数(Derivative)”:
“ $x^2$ 的导数(Derivative)是 $2x$ ”意思是“在每一点,我们正以 $2x$(当前 x 位置的两倍)的速度变化”。(变化的通式)
“导数(Derivative)是 44”意思是“在我们当前位置,我们的变化率(Rate of Change)是 44。”当 $f(x) = x^2$ 时,在 $x=22$ 我们以 44 变化(特定变化率)。
“导数(Derivative)是 $dx$”可能指到下一个位置的微小、假设性跳跃。严格来说,$dx$ 是“微分(Differential)”,但术语会混用。有时人们说“ $x$ 的导数”意思是 $dx$。
注意:我们的模型可能并不完美
我们通过测量并改进它找到了“完美”模型。有时这还不够好——我们在预测如果会$dx$ 不存在会发生什么,但又加上了 $dx$ 来得到初始猜测!
一些不乖的函数(Function)违背了预测:用极限(Limit)去掉 $dx$ 和该瞬间实际发生的情况之间有差异。这些叫做“不连续”函数(Function),本质上就是“无法用极限建模”。你可以猜到,导数(Derivative)对它们无效,因为我们实际无法预测它们的行为。
不连续函数在实践中很少见,常作为“陷阱!”测试题存在(“哦,你试图对不连续函数求导数,你挂了”)。要认识到导数(Derivative)的理论局限,然后认识到它们在测量每种自然现象中的实际用途。你看到的几乎所有函数(Function)(正弦、余弦、e、多项式等)都是连续的。
注意:积分(Integration)其实并不存在
导数(Derivative)、积分(Integral)和反导数(Anti-derivative)之间的关系很微妙(我最初搞错了)。有个比喻。从一个盘子开始,也就是你要考察的函数(Function):
- 微分(Differentiation)是把盘子打碎成碎片。有一个特定步骤:取一个差,找出变化率(Rate of Change),然后假设 dx 不存在。
- 积分(Integration)是称碎片的重量:你的原函数有“这么”大。有一个步骤,累积加法,但它不告诉你盘子看起来是什么样.
- 反微分(Anti-differentiation)是从一堆碎片中推断出盘子原来的形状。
没有算法来找反导数(Anti-derivative);我们得猜。我们做一张查找表,里面有一堆已知导数(Derivative)(原盘 => 碎片堆),然后看现有的堆是否相似。“来找 $10x$ 的积分(Integral)。嗯,看起来 $2x$ 是 $x^2$ 的导数。所以……涂涂写写…… $10x$ 是 $5x^2$ 的导数。”
求导数(Derivative)是机械活;找反导数(Anti-derivative)是门艺术。有时我们卡住:我们取变化,逐块施加,机械地重建一种模式。它可能不是“真正”的原来盘子,但足够好用。
另一个微妙之处:积分(Integral)和反导数(Anti-derivative)不是一回事吗?(我原本也是这么想的)
是的,但这并不显然:这就是微积分基本定理(Fundamental Theorem of Calculus)!(这就好比说“a^2 + b^2 和 c^2 不是一回事吗?是的,但这并不显然:这就是勾股定理!”)。感谢 Joshua Zucker 帮我理清了思路。
阅读数学
数学是一种语言,我想“读”懂微积分(而不是“背诵”微积分,比如像我们能背诵中古德语圣歌那样)。我需要的是定义背后的含义。
我最大的恍然大悟!是意识到 dx 的瞬时角色:它进行一次测量,然后被移除以建立一个完美的模型。极限(Limit)/无穷小(Infinitesimal)只是一种形式化手段,我们不能陷在里面。牛顿似乎没有它们也过得不错。
有了这些类比,其他数学问题也变得有趣了:
- 我们如何测量不同大小的无穷(Infinity)?(某种意义上它们都“无穷”,在另一种意义上区间 (0,1) 比 (0,2) 小)
- 关于让 dx“消失”的真正规则是什么?(无穷小(Infinitesimal)和极限(Limit)到底是怎么运作的?)
- 我们如何在不把数字写下来的情况下描述它们?"0 之后的下一个数字" 是分析学(analysis,我想学习的)的开端。
当你看到基础概念为何存在时,它们就变得有趣了。数学愉快。