aiAGENTINFIDEAS INTO INTERFACES
← 所有文章
AI 工程FIELD NOTES / 2026.10.10

让模型更懂你,先留一组没见过的样本

保留视觉骨干,只训练一个小分类层。如何采样、比较、决定是否启用,才是个人化实验的关键。

只训练最后一小层

见微使用固定的表情视觉网络,把一张面部图像转换成 256 维特征。个人训练保留这个网络,只学习特征与七种标签之间的对应关系。计算量较小,因此训练也可以留在浏览器本机完成。

这不是从零训练一个新的视觉模型。它适合检验固定特征是否已经足够区分你的表达方式,也保留了随时恢复原分类器的可能。

当前个人训练会在类别均衡的基础上,将厌恶的学习损失权重提高到其他类别的 1.75 倍。它仍然需要你标注的真实样本,不能靠增加权重保证更准。

训练数据与验证数据,要分开采

页面先要求每类至少 10 条训练样本,再在训练结束后,每类另采至少 5 条验证样本。后面的样本只用于比较,不参与训练。项目也拒绝重复或近乎完全相同的特征跨越这条边界。

仅仅把同一段视频的相邻帧随机分成两组,仍可能得到过于乐观的结果。更有意义的做法是隔一段时间再拍,改变光线、轻微姿态和拍摄环境。

最低样本数是交互实验的起点,不是“已经足够准确”的证明。

看整体,也看每一类

见微同时展示准确率、宏平均 F1 和各类别召回率,并单列开心、生气、厌恶的精确率与 F1、主要混淆类别。宏平均 F1 让每类占相同权重,帮助发现某些类别被整体表现掩盖的问题。

启用条件项目采用的门槛
宏平均 F1至少提高 2 个百分点
准确率不降低
各类召回率下降不超过 20 个百分点
开心、生气、厌恶精确率和召回率均不下降
已采集歪头样本子集准确率不下降;没有样本则标明未验证

这些是本项目的初始选择条件,不是通用标准,也不是统计显著性证明。样本较少时,一个样本就可能显著影响结果。

当前页面会降低中性分数、适度提高厌恶分数。基础模型与个人分类器的验证均应用同一规则,避免比较两套不同的决策偏好。分数加权会影响误报与漏报,不等于模型已经重新学习。

验证通过后,由人决定启用

训练完成不会自动替换原始模型。只有验证达标,页面才允许用户启用个人分类器。启用后,结果混合了原分类器 30% 和个人分类器 70% 的分数;用户可以随时停用。

如果导入一份保存的分类器,还需要在本机另采样本重新验证。模型在之前的一组样本上表现好,不代表换一天、换光线或换一个人后仍然合适。

给结论留出边界

用于选择模型的验证集,不是最终独立测试集。若想对外声称精度提高,还需要一组没有参与模型选择的测试数据,以及更有代表性的使用场景。

这里判断的是可见表情样式。分类分数不是人的真实内心感受,也不等于准确率。保留“不确定”的结果,是这个实验的一部分。

TRY IT YOURSELF

回到见微,亲手试一试。

打开表情实验室 →