Xing Lab markXing LabFudan University

实验室指南

English中文

科研实践

关于数据、论文、图件、文档、代码、LLM 使用、审稿和共享科研资源的实践标准。

0

翻译说明

本中文版本由ChatGPT辅助翻译和整理,可能有遗漏、错误或不够准确的表述。如与英文版不一致,请以英文版为准;也欢迎告诉我们需要修改的地方。

01

致谢

本指南部分参考了 Coley Research Group @ MITWang Bioinformatics Lab @ UC Riverside 公开分享的实验室指南和资源。感谢这些课题组把经验开放给更广泛的科研社区。

02

概览

科研实践关注的是一组习惯:让我们的工作清楚、可复用、可信赖。本页包括数据、论文、图件、文档、代码、LLM 使用、审稿和阅读资源。

核心是可重复性:未来的自己、组内同事、合作者、审稿人和读者,都应能看懂我们做了什么、为什么做,以及证据如何支持结论。

03

数据

原始数据是科学记录。无论是否进入最终论文,都应保存、整理、备份和记录。

保存原始数据

  • 保存所有原始数据,包括探索性结果、失败实验、对照、样本,以及最终论文未使用的文件。不要覆盖原始文件。
  • 原始文件应与处理后数据、清理表格、导出图件和分析结果分开保存。
  • 如果某些数据需要排除,请记录原因,不要删除文件。

组织项目数据

  • 原始数据、处理后数据、元数据和分析输出应放在命名清楚的位置,并记录处理步骤、关键参数、样本信息和质控决定。
  • 文件夹和文件名请包含清楚的日期与含义,方便之后重建项目进展。
  • 合作者和未来的组员应能看懂重要文件在哪里,以及每个结果使用的是哪个版本。

备份

  • 早备份,常备份。重要项目数据尽量保存在两个以上位置,例如外置硬盘加实验室 NAS、学校认可的存储空间,或合规云存储。
  • Mac 用户可以使用 Time Machine 配合外置硬盘或网络存储。Windows 用户可以使用 File History 备份到外置硬盘或网络位置;请确认项目文件夹也被包含在备份中。
  • 请定期测试备份能否恢复,尤其是在清理文件、更换电脑、投稿或公开数据前。

04

论文写作

从故事线开始

  • 在润色文字之前,论文大纲应先把逻辑讲清楚:问题为何重要,空白在哪里,我们有什么证据,结果为什么值得读者关心。
  • 围绕图和表搭建大纲。每个主要结果都应对应一张图、一张表,或一项清楚描述的分析。

大纲组成

  • 摘要:用 5-10 句概括背景、空白、方法、主要结果和意义。撰写或修改时,可参考 摘要写作指南
  • 引言:说明大问题、具体问题、已有工作、本文不同之处,以及主要贡献。
  • 结果:列出关键图表。尽早起草图注,让每张图都有清楚的信息。
  • 讨论:写清解释、局限、有数据支持的结论,以及未来改进方向。
  • 方法和补充信息:包括实验、对照、数据集、方法细节、补充图,以及对可重复性重要但不适合放入正文的内容。

起草与修改

  • 尽早起草,让修改能改善科学内容,而不只是润色措辞。
  • 把批注和修订当作学习过程,而不是机械接受修改。
  • 将论文草稿发给 PI 时,请使用清楚的文件名,包括项目名、你的姓名缩写和日期,例如:ProjectName_SX_20260901.docx。

补充信息

  • 补充信息通常准备为两个文件:一个 Word 文档放补充图和补充说明(如适用),一个 Excel 文件放补充表。
  • Nature 系列期刊通常还需要单独的 source data Excel 文件。

论文模板

下载 Word 模板
  • 不同期刊格式要求不同;准备最终版本时请查看作者指南。

05

图件

每张图的最低标准

  • 无论是组会、草稿、海报还是投稿,图件都应清楚、整洁、专业。
  • 即使是内部草稿,也应让读者不用猜就能看懂:画了什么、比较了什么、支持什么结论。
  • 任何阶段,坐标轴都应有清楚的标签,需要时也要有单位;图例或直接标注应解释分组、颜色、符号和缩写。

发表与投稿标准

  • 避免不必要的边框、粗重网格线、装饰效果和难以区分的颜色。Less is more.
  • 整张图使用 Arial(或 Helvetica),包括标签、图例、注释和 panel 字母。
  • 在最终印刷尺寸下,大多数文字应为 4-10 pt。
  • 所有 panel 应保持字体大小、线宽、点大小、配色、panel 标注和化学结构风格一致。
  • 图注应说明展示内容、样本量和统计方法;需要时,也请给出精确 p 值。

图件组装

  • 使用支持矢量编辑的工具,例如 PowerPoint、Adobe Illustrator 或 Inkscape。我个人通常用 PowerPoint 组装图件。
  • 除非期刊有特殊要求,尽量保存为 SVG 等矢量格式。
  • 如果矢量文件过大或不实用(如大型 UMAP 图),可导出 PNG 或 JPEG,分辨率不少于 600 DPI。
  • 组装多 panel 图时,按最终论文图或海报尺寸导出,避免后续反复缩放。
  • 如果 panel 分别生成,请保持坐标轴大小、标签位置、字体和线宽一致。

化学结构

  • 化学结构通常用 ChemDraw 绘制,采用 Nature 或 ACS 风格。
  • macOS 上建议从 ChemDraw 导出 SVG。Windows 上复制粘贴到 PowerPoint 通常也能保留矢量质量。

绘图与可重复性

  • 尽量用 Python 或 R 程序化生成定量图(我个人更偏好 Python)。这样数据更新、分析重跑或修稿时,图件都更容易复现。避免手动在 Excel 或 Prism 中作图。
  • 绘图代码、处理后数据和导出图件应放在一起。
  • 数据可视化入门可参考:From Data to Viz
  • 可用这个模板作为组装论文图和报告图的起点。

06

文档与代码

未来的自己、组内同事、合作者和审稿人,都应该能理解我们做了什么、为什么这样做。

工作记录

  • 每个人都应为实验和分析保留科研记录,可以是电子记录,也可以是手写实验记录本;记录要足够详细,方便之后理解和回顾。
  • 记录重要选择背后的原因,不只记录做了什么。
  • 文件、幻灯片、草稿和结果文件夹请使用清楚的日期和名称。

代码与可重复工作流

  • 代码项目尽量使用版本控制。
  • 整理脚本和 notebook,让主要分析路径不依赖记忆也能看懂。
  • 写 README,说明文件夹结构、主要脚本、输入输出和运行顺序。
  • 记录软件环境、包版本、操作系统或服务器,以及重跑所需的外部工具。
  • 公开代码前,请仔细检查是否包含私人数据、账号凭据、未发表的合作者材料或许可问题。

07

大语言模型(LLMs)

LLM 是有用的科研工具,我们可以积极使用,也要认真验证。

LLM 和 AI 助手可以帮助编程、文档、文献初筛、提纲、编辑、头脑风暴、分析规划和报告准备。它们最有价值的时候,是让我们更快、更清楚、更谨慎,而不是替代理解。

责任与验证

  • 你有责任理解自己提交的每一行代码,也要对每一项分析和结论负责。不要在没有理解和验证的情况下接受 LLM 输出;请用测试、检查、来源核对和代码审查来确认。
  • LLM 通常更擅长常见编程和写作任务。面对专业预测、未发表事实或高度领域化的科学判断时,它们可能不可靠。
  • 不要把科学判断或创新性外包给工具。让工具帮助执行和澄清思路,同时继续发展自己的判断力。

上下文与隐私

  • 好的结果需要好的上下文:提供相关代码、预期输入输出和清楚的任务说明。
  • 未经适当批准,不要将敏感数据、私人论文稿件、保密代码、未发表的合作者信息、账号凭据或专有材料粘贴到云端工具中。

08

审阅论文

  • 保持善意。写审稿意见时,请记得对面是真实的人,也在认真对待自己的工作。
  • 可以的话,先指出主要优点。这能帮助作者和编辑理解哪些内容值得保留。
  • 区分技术正确性新颖性或重要性。正确的论文可能影响有限;有潜力的论文也可能需要更强证据。
  • 当结论被夸大时,请指出具体结论,并说明数据支持什么、不支持什么。
  • 对于每个主要问题,尽量提出解决方案,即使方案并不完美。这比只说哪里不对更有帮助。

09

阅读清单与关键论文

这些是组内成员应逐步熟悉的关键论文和工具。目标不是记住所有细节,而是理解每篇论文贡献了什么、每个工具适合做什么,以及它们如何连接到我们的工作。

关键研究论文和工具论文

这些研究论文和工具论文定义了实验室常用的重要概念、工作流和资源。

常用工具链接

请逐步熟悉这些资源的用途,以及什么时候适合从这里开始。