ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

人机交互实验复盘:从可用性测试到数据驱动改版

人机交互实验复盘:从可用性测试到数据驱动改版 简介面向人机交互课程学习者这份资料覆盖基础实验到期末综合大实验整合多份实验报告、课件与可运行工程。共86个文件包括doc/ppt实验报告和教学课件、bmp界面截图与图标素材、cpp/h源码及编译生成的可执行文件、wrl虚拟现实场景、pdf辅助资料等压缩包约24.97MB按实验一至实验四组织。内容涉及二维交互画图板、交互式语音程序、订单管理系统界面设计、VRML虚拟现实交互并提供BBS系统与飞机订票查询系统界面设计文档可对照学习用户研究、交互模式设计、可用性评估与无障碍设计。其中最后大实验展示了从需求分析、原型制作到用户测试的完整流程适合需要完成课程报告或准备期末综合大实验的学生直接参考。已有2480人学习下载其中的实验报告结构、源码注释和可运行程序能减少重复搭建环境的时间。 我拿到人机交互这门课的实验手册时第一反应是六个小实验加一个期末大实验这不是要把人榨干吗真正做完一整轮之后我才意识到这些实验拆开看是六个孤立任务合起来其实是一套完整的能力训练——把一个交互设计从我觉得不错变成有数据支撑、能发现问题、能验证改进。这篇文章就把我当时做基础实验和期末大实验的完整过程复盘一遍重点讲清楚每个实验的底层逻辑、具体操作、关键数据和踩坑记录给正在做人机交互实验、或者准备期末大实验的同学一个可以直接参考的流程范本。1. 实验设计的底层逻辑所有小实验都在围绕同一个评估闭环1.1 实验手册刚到手时我的第一反应是这跟我想的不一样拿到实验指导书的时候我满脑子都是问题为什么人机交互课要我们做可用性测试为什么还要学量表计分规则甚至还要我们把测试过程录下来逐帧看回放当时我以为这门课最后就是写一个网页、画一套界面交差就行结果发现完全不是这么回事。直到做完第一个实验我才反应过来这门课练的东西不是怎么把页面做漂亮而是怎么严谨地判断一个页面到底好不好用。这个判断力才是人机交互领域最核心的通用能力。界面好不好看是审美问题界面好不好用是工程问题工程问题就要用数据说话。1.2 我把所有实验重新梳理了一遍发现它们是一条线整理笔记的时候我把六个小实验和一个大实验按输入-处理-输出的方式重新排了一遍发现它们其实是一条完整的评估链路需求侧用户是谁、在什么场景下、要完成什么高频任务设计侧基于需求产出低保真原型、高保真原型评估侧用任务测试、专家评审、主观量表去采集数据决策侧根据数据结果定位问题、排优先级、进行改版验证侧改版之后再做一轮评估看指标是否真的提升了这套链路说白了就一句话没有数据支撑的我觉得好用都不可信。我在大实验答辩的时候被老师问到的第一个问题就是你怎么证明你的设计改进了如果只拿出视觉更好看了这种理由这题基本就挂了。但如果你能拿出任务完成时间从156秒降到78秒、任务成功率从80%升到100%、SUS量表得分从61.5涨到82.5哪怕样本量不够做显著性检验老师也会觉得你真正理解了这个学科的方法论。1.3 用体检来做类比整个实验体系就非常好懂了我可以给你一个特别直观的类比给界面做评估跟给人体做体检是同构的。测量任务完成时间和出错率相当于量血压、测心率——看你的身体能否稳定支撑基本运转做启发式评估相当于医生凭经验问诊触诊——快速锁定可疑病灶发SUS和NASA-TLX量表相当于抽血化验——把用户主观感受变成可比较的生化指标。体检报告不能只有一项数据界面评估也一样需要行为数据、专家意见、主观感受三者互相印证结论才站得住。2. 基础实验实操记录我把三个小实验压到同一套自习室系统上2.1 可用性测试5个人、3个任务、1台录音设备就够了我第一个做的实验是可用性测试。当时我在实验手册里看到招募5名被试这几个字时差点笑出声5个人能测出什么来后来查了尼尔森那篇经典文章才明白可用性测试的核心经验法则是5个用户就能暴露约85%的可用性问题再多招人边际收益急剧下降。我当时的做法是拿校内普遍存在的找空自习室场景做了一个简单的网页原型然后设计3个任务任务编号任务描述成功标准任务1快速找到当前有空座位的自习室用户能在首页直接定位到空闲教室列表任务2查看某教室的实时人数并收藏该教室用户能打开详情页完成收藏操作任务3取消一个已提交的预约并重新预约用户能在10秒内找到取消入口并完成操作测试流程上是这么安排的先给被试读一段统一的引导语强调你不是在被测试是这个系统在被测试然后让被试执行任务要求全程出声思考主持人在旁边记录任务完成时间、出错次数和卡顿位置。测完之后我再追问两个开放问题你觉得最让你困惑的地方是什么如果再给你一次机会你会怎么操作真实数据大概是这样的第一个任务平均耗时156秒只有4个人直接完成第三个人在首页反复点击教室卡片完全没注意到顶部有空闲优先筛选按钮。第三个任务更惨5个人里只有3个成功另外2个人都在取消预约入口上卡了超过两分钟最后直接说我不找了。这组数据后来成了我做大实验改版的第一手依据。2.2 启发式评估一个人也能做的专家评审第二个实验是启发式评估。它和可用性测试最大的区别在于可用性测试需要拉真实用户启发式评估是让评估者扮演专家拿一套既定的规则去审视界面。最常用的是尼尔森的10条可用性启发式包括系统状态可见性、系统与现实世界的匹配、用户控制和自由、一致性和标准、错误预防等等。我当时的执行方式是一个人对着页面逐条过10条启发式记录发现的问题然后对每个问题进行严重度分级。严重度分级我采用的是0到4级的五档标准0级是完全没问题1级是仅影响美观2级是有一定阻碍但可以绕过3级是显著影响任务完成4级是用户无法完成任务且无替代路径。这一轮我一个人就找出了6个问题其中最要命的是两条一条是取消预约入口藏在教室详情页最底部严重度给了3级另一条是提交预约之后页面没有任何加载反馈用户会误以为没提交成功导致重复点击严重度也给了3级。这两个问题后来又在可用性测试里被真实用户踩中说明启发式评估的效率其实很高虽然它不能替代真实用户测试但能在花大价钱招被试之前先扫掉一批明显的雷。2.3 问卷量表把主观感受变成可比较的数字第三个实验是主观量表评估我用了两套经典工具一套是SUS系统可用性量表另一套是NASA-TLX任务负荷指数。SUS是10道题的标准化问卷奇数题正反向计分、偶数题反方向计分最后换算成0到100的综合得分。计分规则很多人第一次算会算错我这里说清楚10道题每题按1-5打分奇数题1、3、5、7、9的得分是用户打分减1偶数题2、4、6、8、10的得分是5减用户打分10道题相加之后再乘以2.5得到最终的SUS分数。我当时给第一版原型测出来的SUS是61.5处于C级偏D的勉强能看区间。NASA-TLX则把主观负荷拆成6个维度脑力需求、体力需求、时间需求、绩效、努力程度、挫败感。当时这套系统是纯鼠标点击操作体力需求大家普遍打分不高但脑力需求平均给了62分挫败感更是飙到55分两条高分项和可用性测试里用户卡顿的地方完全对应上了。这就是我前面说的数据互相印证——行为数据告诉你用户在哪里卡住了量表数据告诉你用户在这个过程中的主观感受有多差两组数据一对上问题优先级瞬间就清楚了。3. 最后大实验的设计思路从零做一款可评估的交互原型3.1 选题不贪大校园共享自习室查询系统到了期末大实验我们组的选题没有搞什么元宇宙、人工智能大模型这种听起来吓人的概念而是选了一个非常接地气的场景校园共享自习室查询与座位预约系统。选题逻辑很简单——在我们学校自习室分布在好几栋教学楼里空不空、有没有插座、是中央空调还是风扇这些信息完全靠学生自己人肉打听每天都有大量时间浪费在跑到教室门口发现满员这种破事上。需求收集阶段我们做了5个人的半结构化访谈又发了一轮线上问卷最终收到43份有效回复。访谈里有一个信息非常关键考研党是最高频的需求群体他们一天要在多个教学楼之间切换对空座率电源插座是否安静这三项信息的需求度最高。这个发现直接决定了我们后续任务场景的设计——大实验的可用性测试任务就必须围绕考研党的一天来写而不是随机编几个操作。3.2 低保真原型与组内互评花最少的时间换最多的改版意见正式设计阶段我先没碰任何原型工具直接在纸上画了几版低保真线框图首页要不要放搜索栏筛选条件放顶部还是侧边教室详情页信息密度要不要这么高这些界面布局问题在纸面上改一版只需要几秒钟比在Figma里调整一百个图层快得多。画完线框图之后我拉来两个没参与这个项目的同学做了一轮组内互评用启发式评估的方式过了一遍。这一轮又发现了6个问题改动量最大的一个问题是初始设计里某个教学楼没有空闲座位时会在列表里置灰显示但多位同学指出这样很容易让用户误以为系统故障。最终我们改成了默认隐藏、需要手动展开的方案这个小改动的逻辑是用户找自习室的第一诉求是现在哪里能坐而不是哪里不能坐。3.3 高保真原型与正式评估方案设计低保真方案定稿之后我用Figma搭了高保真原型。做评估之前我和组员把实验方案完整写了一遍因为大实验的评估环节是要算进成绩的方案本身就是要交的材料之一。评估方案的核心设计是这样的评测量任务完成率、任务完成时间、操作错误次数、SUS量表得分、NASA-TLX各维度得分被试安排第一轮5人改版后再安排另一批5人总样本量控制在10人左右测试设备统一用同一台笔记本电脑和同一个浏览器窗口防止设备差异干扰数据记录方式全程录屏加录音主持人用结构化表格现场记录操作路径和卡顿节点任务集一共4个任务涵盖找空座位、筛选条件、收藏教室、取消预约四个核心操作实验方案里有一件事需要我们反复讨论清楚被试遇到问题的时候主持人到底能不能帮忙我们的结论是不能直接帮但可以记录卡住的时间节点和用户口中说出的疑问。因为可用性测试被测的是系统而不是用户一旦主持人出手干预任务完成时间就不再是纯系统性能的反映了。3.4 改版逻辑不是只改视觉而是专项修复每个被数据命中过的问题第一轮可用性测试结束之后我们拿到的数据不算好看任务4取消预约的完成率只有60%平均耗时212秒比其余任务高出一大截任务1的平均耗时156秒用户在第一屏的筛选区停留时间过长。对照启发式评估和NASA-TLX的数据我们锁定了5个严重问题作为必改项首页没有按空闲优先排序用户需要逐个点开教室详情才能确认取消预约入口在详情页最底部且没有二次确认弹窗筛选条件没有电源插座楼层这些用户高频提及的选项列表行高过小用户连续点击时容易误触到相邻行提交预约按钮点击后没有任何加载反馈用户会重复点击改版时我的原则是一个数据点至少对应一次明确的交互改动不接受顺手改好看的这种无依据设计。以空闲优先为例不仅把首页列表默认改成按可用座位率排序还在教室卡片左上角增加了空闲/较多/拥挤三色状态标签屏幕阅读器也能读出来。以取消预约入口为例把它从详情页末尾挪到了页面顶部的操作栏并且点击后弹出确认对话框明确显示取消后座位将立即释放。4. 两轮测试的数据对比结论是这样从数字里长出来的4.1 行为数据完成率、耗时、错误次数都有明显变化第二轮测试的数据是在改版后采集的我们把两轮结果放在同一张表里对比指标第一轮5人第二轮5人变化任务1完成率80%4/5100%5/520%任务1平均耗时156秒78秒-50%任务2完成率100%5/5100%5/5不变任务2平均耗时95秒45秒-52.6%任务3完成率60%3/5100%5/540%任务3平均耗时212秒89秒-58%人均操作错误次数2.6次0.8次-69.2%每一条数据我都能说清背后的原因任务1耗时的下降来自空闲优先排序用户不再需要挨个点开教室详情任务3完成率的上升来自取消预约入口上移以及二次确认弹窗带来的心理安全感操作错误次数的减少来自列表行高的增加和相关筛选条件的补全。4.2 量表数据SUS从61.5到82.5NASA-TLX各维度全面改善量表数据同样能对得上。SUS总分从第一轮的61.5涨到第二轮的82.5过了80分这条被广泛当作优秀的参考线。NASA-TLX各维度的平均分变化也很明显NASA-TLX维度第一轮平均分第二轮平均分方向脑力需求6238降低时间需求5835降低绩效6585提升努力程度6040降低挫败感5525降低这里有一个容易被忽视的点NASA-TLX里的绩效维度是正向的其他维度都是负向的写报告时方向不能搞反。另外由于样本量小我们没有做显著性检验但行为数据的大幅变化、量表数据的同向趋势、加上回访时用户的具体描述三方面证据链是一致的这比单独一个P值更有说服力。4.3 定性数据出声思考记录里捞出来的关键线索除了硬指标出声思考的记录也提供了很多重要信息。第一轮测试的时候有用户在做任务1时自言自语说这个筛选按钮太远了我第一眼只看中间的大地图这说明用户的心智模型是地图当前位置而不是设计师预设的列表筛选。第二轮改版后我们在首页保留了按楼栋分区的入口但把空闲优先列表直接提到了首屏最上方属于顺着第一轮测试给出的线索做的调整。另一个启发来自取消预约任务第一轮成功完成的3位用户里有2位是靠瞎点误打误撞找到入口的他们在回访时说这个功能平时根本不会想到在这。这句话提醒我们像取消预约这类低频高危操作光把入口做得能找到不够还要做到出现在用户预期位置。所以第二轮我们把入口从详情页移到了每个教室卡片的二级菜单里并且在预约成功后的提示页放了一个管理我的预约的直达按钮双重入口解决了那个60%完成率的问题。5. 实验中最容易翻车的五个细节与我的处理方式5.1 任务描述太抽象用户直接愣在现场第一次小实验的时候我把任务1写成查找学校图书馆的自习室空闲情况结果被试反问我图书馆哪个校区现在几点算当前整个任务的前两分钟全耗在解释题目上。后来我把任务描述改成情境化表达比如假设现在是下午3点你想找一间有电源插座且目前有空位的教室请你完成从查找到收藏的整个过程。情境化任务的好处是它模拟了用户在真实生活中的思维状态而不是让用户去执行一条像命令行一样的指令。5.2 出声思考要反复提醒不然用户会憋着不说话出声思考协议Think Aloud看起来简单实际执行起来非常困难。很多被试一旦进入操作状态就会自动安静下来盯着屏幕沉默操作。我的处理方式是在测试桌旁边贴一张小纸条写着请说出你在想什么同时在每个任务开始前口头提醒一次。被试一旦沉默超过15秒主持人就会语气平和地追问一句你现在在想什么这句话的表达很关键不能问你是不是卡住了因为这会暗示用户承认自己失败影响后续心态。5.3 量表题目要本土化翻译直译会让人看不懂SUS和NASA-TLX都是英文量表直接机翻容易产生很拗口的句子。比如SUS里的I think that I would like to use this system frequently如果直译成我认为我会频繁使用这个系统其实还行但NASA-TLX里的temporal demand直译成时间需求就会让很多被试用困惑的眼神看着你。我当时的处理是在每个维度下面加一句白话解释时间需求你完成任务时觉得时间紧张吗这样既保留了量表的结构效度又提高了填写质量。5.4 数据录入不及时后期整理会痛苦到怀疑人生我们第一轮测试的时候几个人分工记数据录完直接写在草稿纸上想着晚上统一录入Excel。结果晚上对着潦草的笔记和几段录像光是核对某个任务的耗时到底是多少就花了两小时。第二次测试我改用在线表格每位被试测完立刻当场录入录像文件也在当天完成命名归档。别小看这个细节大实验答辩前的通宵赶工绝大多数都是在为这种欠账买单。5.5 组内分工不均会让评估结果失去一致性大实验我们是四人组队第一轮测试时大家各自分工一个人念引导语一个人记录一个人管录像一个人发量表。听起来合理但实际上每个人的记录口径都不一样有人记用户点了3次错误的按钮有人只记任务失败最后汇总时根本没法合并统计。后来我们改成了先跑一场预测试四个人同时记录同一个被试然后统一记录格式和判定标准这才解决了数据一致性的问题。这也是实验报告里需要写评估者间信度的原因——没有统一口径的数据再漂亮的分析都是空中楼阁。回过头看整门课最值钱的不是最后交上去那份报告而是你终于能独立回答一个看似简单的问题这个界面到底好不好用怎么证明它好用这个问题没有标准答案但你有了一整套收集证据的方法——招人来做任务、请专家来挑刺、发量表量化感受、把录像翻来覆去看几遍然后再据此改设计、重测、对比数据。把这个闭环跑顺人机交互实验才算真正入门了。本文还有配套的精品资源点击获取
返回列表