
一 | 央视网消息:4月24日,神舟十八号航天员乘组叶光富、李聪、李广苏在酒泉卫星发射中心问天阁与中外媒体记者见面。那么,这一次的“太空出差三人组”是如何选拔出来的呢?据中国载人航天工程航天员系统总设计师黄伟芬介绍,神舟十八号乘组的选拔遵循统筹规划、以老带新、新老搭配的基本原则进行。 8 月 24 日消息,据外媒 Phys.org 今天(24 日)报道,卡迪夫大学和墨尔本大学的一项新研究发现,生成式人工智能(GenAI)目前还无法像人类教师一样可靠地评判学生的书面作业。研究人员使用 ChatGPT 的两个版本,对 50 篇生物科学专业本科生论文进行评分,以测试大模型评估学生作业的能力。此外,在选拔时还深入全面分析了本次任务的特点,以及任务对航天员身心素质、知识储备和技能等方面的要求。ChatGPT 需要按照 7 项标准批改这些论文,研究人员还采用了 4 种不同的提示方式,随后将大模型与人工评分的平均分和分数波动情况进行比较。 黄伟芬称:“我们根据这个任务的特点来确定需要选什么样的航天员。图源:Pexels卡迪夫大学生物科学学院威廉 · 凯博士指出:“研究结果显示,模型给出的分数波动很大,无法准确预测人工评分。

二 | 对于神十八任务来讲,因为还是有出舱活动的任务,这个出舱活动的任务对航天员的要求还是很高的。” 目前任务期已接近尾声的神舟十七号乘组进行了两次出舱任务,他们的主要工作围绕空间站的维护和维修展开,而神舟十八号出舱的主要任务是空间站的防护。黄伟芬介绍,随着空间站在轨运行时间的推移,难免会遇到一些新的问题和情况,因此,航天员的任务会有更多的动态调整。生成式 AI 与人类批改同一批论文时存在明显差异。只看论文总分,两者给出的结果相对接近;一旦具体到每项评分标准和每一篇论文,大模型与人工评分之间的差距就相当明显。 黄伟芬介绍:“在神十七乘组飞行前,那个时候我们规划的出舱活动的任务和他们飞行中实际实施的出舱活动任务是有所调整的,这是一个常态,未来它也是一个常态。我们每次出舱有计划内的出舱,也有可能计划外的临时的新增的出舱活动的任务,所以我们每次任务都是不一样的。” 针对未来已知和未知的任务,黄伟芬说,神舟十八号乘组的选定正是考虑到这样的新特点。 黄伟芬表示,神舟十八号乘组是首个“80后”航天员组成的一个乘组,我们叫“80后”乘组,三名男性的航天驾驶员年富力强,很有朝气。

三 | ”除一种情况外,AI 模型给出的平均分普遍高于人工评分。他们经过乘组的训练,目前配合非常默契,身心状态各方面都非常好,具备了执行任务的能力。 此外,黄伟芬还介绍,目前我国航天员乘组的选拔策略并不是局限于一次任务选拔一个乘组,而是有长远的统筹性安排。

四 | 黄伟芬称:“所以我们在选拔的时候,不仅要看神舟十八号飞行任务对航天员的要求,我们还得看后续的任务,所以我们要统筹规划、统筹安排,考虑他们和任务的匹配性、他们彼此之间的相容性,但是我们也要统筹规划合理的布局。平均分方面,AI 模型与人工评分的最大差距达到 16.1 分;具体到单篇论文,最大差距达到 40 分。

五 | 进入应用发展阶段之后,我们一次是选两个乘组,这是我们在应用与发展阶段的一个选拔策略,这和我们在空间站的建设期一次选出4个乘组的策略是有所调整的。获悉,威廉 · 凯还发现,AI 往往会压低高分论文的成绩,又把低分作业的成绩抬高,最终使分数系统性地向中间集中。研究结果说明,至少现阶段,即使经过大量训练,AI 仍无法可靠地对主观性较强的书面作业给出与人类相当的分数。

六 | “我们测试的大模型目前并不适合取代教师,为学生预测作业成绩。”研究人员指出,高等教育领域确实很关注大模型能否利用模式识别能力,让学生作业评分更加客观,同时提高批改效率、减轻教职人员压力。

七 | 但这项研究表明,目前并不适合这么做。此外,未经学生明确同意便把作业提交给 AI 工具,本身还涉及伦理问题;大模型也不能、也不应该被依赖来给学生的长篇书面作业评分。“随着大模型继续发展,未来模仿人类判断的能力可能会提高。但从这项研究来看,要让 AI 给出的分数与人工评分真正保持一致,恐怕并不容易。
Current article:http://gqp0cl.naoninanglouzhei.bond/news/20260826_5747611.html
Published on:02:28:28
国内/08-21
国内/08-22
国内/08-22
国内/08-21
国内/08-20
国内/08-23
国内/08-24
国内/08-25
国内/08-25