Recently, the Segment Anything Model (SAM) gains lots of attention rapidly due to its impressive segmentation performance on images. Regarding its strong ability on image segmentation and high interactivity with different prompts, we found that it performs poorly on consistent segmentation in videos. Therefore, in this report, we propose Track Anything Model (TAM), which achieves high-performance interactive tracking and segmentation in videos. To be detailed, given a video sequence, only with very little human participation, \textit{i.e.}, several clicks, people can track anything they are interested in, and get satisfactory results in one-pass inference. Without additional training, such an interactive design performs impressively on video object tracking and segmentation. All resources are available on \url{https://github.com/gaomingqi/Track-Anything}. We hope this work can facilitate related research.
翻译:近期,Segment Anything模型(SAM)因其在图像分割领域的卓越性能而迅速受到广泛关注。尽管该模型在图像分割方面表现出强大的能力且支持多种提示交互,但我们发现其在视频中的一致分割性能欠佳。为此,在本报告中,我们提出Track Anything模型(TAM),该模型在视频中实现了高性能的交互式跟踪与分割。具体而言,给定一段视频序列,仅需极少的人工参与(例如数次点击),用户即可跟踪任意感兴趣的目标,并在单次推理中获得令人满意的结果。无需额外训练,这种交互式设计在视频目标跟踪与分割任务中展现出令人印象深刻的效果。所有资源均可在\url{https://github.com/gaomingqi/Track-Anything}获取。我们希望这项工作能促进相关研究。