计算机现在无处不在。手机是计算机。汽车里有计算机。家里的电视也是计算机。这些计算机都需要思考。它们需要解决问题。计算机思考的方法叫算法。算法就是步骤。像做菜的食谱。一步一步来。计算机按照算法工作。好的算法速度快。差的算法速度慢。
我们现在有很多数据。照片是数据。聊天记录是数据。买东西的记录也是数据。计算机要处理这些数据。它需要找到有用的信息。比如推荐你喜欢的电影。或者认出照片里的人。这需要一种特别的算法。这种算法叫机器学习。机器学习让计算机自己学习。我们给计算机看很多例子。计算机自己找到规律。
比如教计算机认猫。我们给计算机看一万张猫的照片。也给它看一万张不是猫的照片。计算机自己看这些照片。它找出猫的特点。圆眼睛。尖耳朵。有胡子。下次看到新照片。计算机就能判断是不是猫。这就是机器学习。它现在很有用。脸识别。语音助手。自动驾驶。都用机器学习。
但机器学习有个问题。它需要很强的计算机。需要很大的电。训练一个识别猫的系统。要用很多电。这些电够一个家庭用很久。这不好。我们想要省电的计算机。我们想要快速的算法。这就是研究的新方向。怎么让机器学习更省力。怎么让算法更聪明。
一个办法是让算法简单点。不要搞太复杂。复杂的算法想得多。想得多就慢。简单的算法想得少。想得少就快。但简单的算法可能不准。它可能认错猫。把狗当成猫。所以要想新办法。既要简单又要准。这很难。科学家们在想办法。
他们看人的大脑。人的大脑很省电。人脑一天只用一点电。比电脑少多了。人脑认猫很快。小孩看几次猫就认识。人脑怎么做到的?人脑不是什么都算。它只看重要的地方。看猫的眼睛胡子。不看背景。不看无关的东西。计算机算法也在学这个。只看关键的数据。不处理没用的信息。这叫注意力机制。像人的注意力一样。只关注重要的。
另一个办法是专门做小模型。以前的模型很大。像巨人。要记住很多东西。现在做小模型。像小孩子。只记住最重要的。小模型放在手机上。不用联网也能用。保护隐私。还省电。小模型怎么和大脑一样聪明?科学家在改进训练方法。让模型学得更精。不要死记硬背。要理解意思。
数据也很重要。干净的数据好。干净的数据就是正确的数据。标得清楚的数据。照片里确实是猫。标签就写“猫”。不是猫就不要写“猫”。乱七八糟的数据不好。计算机学不会。现在有很多不干净的数据。网上图片乱七八糟。标签是错的。这给学习带来困难。所以要先整理数据。把数据洗干净。这工作很枯燥。但很重要。
还有硬件的问题。计算机的芯片在变。新的芯片专门为机器学习设计。它们算得快。还省电。这些芯片模仿人脑的结构。叫神经形态芯片。它们不是一步一步算。它们同时算很多事。像人脑的神经元同时工作。这很有前途。芯片快了。算法简单了。机器学习就能更普及。
安全也是大问题。机器学习系统可能被攻击。比如让计算机认错猫。在猫照片上加一点噪音。人眼看还是猫。计算机就认成狗。这很危险。自动驾驶如果认错标志。就会出事故。所以要研究安全的算法。让算法稳定。不容易被骗。这需要算法有常识。像人一样知道猫不会突然变成狗。
公平也要考虑。算法训练用谁的数据?如果用一部分人的数据。算法就对另一部分人不公平。比如人脸识别。如果用浅肤色的人数据多。深肤色的人就可能认不准。这不好。算法要公平对待所有人。训练数据要全面。代表各种各样的人。算法设计也要考虑公平。不能有偏见。
这些研究都在进行。世界各地的科学家在努力。他们写论文。分享想法。做实验。改进算法。目标很明确。让机器学习更好用。更省电。更安全。更公平。让每个人都能受益。老人可以用语音助手。农民可以用手机看庄稼病害。医生可以用算法帮忙看病。学生可以用电脑辅助学习。
这不是魔法。这是一步一步的工作。改进一点数据。调整一点算法。设计一个新芯片。每一点进步都有用。积累起来就是大变化。计算机论文就在写这些进步。新的算法。新的想法。新的实验结果。这些论文不长。但信息很多。它们推动整个领域向前走。
我们普通人也能懂一点。虽然不写代码。但知道原理有用。知道计算机怎么工作。知道它能做什么。不能做什么。我们使用技术就更明白。我们提出要求也更合理。我们希望技术服务人。不是人伺候技术。简单可靠的算法。方便省电的设备。安全公平的系统。这是大家共同的目标。
未来的计算机会更安静。更融入生活。它不会打扰你。它默默帮忙。它更懂你的需要。它更保护你的隐私。这一切靠背后的算法。算法在进步。每天都在进步。论文记录这些进步。分享这些进步。这就是计算机研究的意义。让机器更聪明。让生活更轻松。