{"as_of":"2026-08-09T19:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c5f4fef63a9cf67e36f06159d072508d82fd512c853add9ccd0ad10b134fb6b","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:55:13.116562Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19743/citation-record","integrity":"/paper/2607.19743/integrity","json":"/paper/2607.19743/citation-record.json","paper":"/paper/2607.19743"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T11:55:09.112671Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.112671Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:8a14e91f3057e6a14e2568a682edb8043baf3660fee37f103f8d2387f7d68aa8","observation_id":"8a2dbc7e-fd6c-4d63-8c19-233bcc142f96","resolution":{"observed_at":"2026-08-01T11:55:09.112671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.171350Z","title":"Learning what to learn for video object segmenta- tion","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.171350Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:bd2139b35463620c0be16e2bf20868dd1b7bac6be2a723e0d924c4b91bb1ae18","observation_id":"aa074ca9-5d26-43f1-940b-ecf86f027e6c","resolution":{"observed_at":"2026-08-01T11:55:09.171350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.282049Z","title":"One- shot video object segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.282049Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:3e7db4a053e78be7f00d47593656d998bd66bf570066ce0dee562f4445373e27","observation_id":"1d0de68f-9b07-41d9-a368-41acf1273e7b","resolution":{"observed_at":"2026-08-01T11:55:09.282049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13803","last_updated":"2025-05-31T11:24:10Z","snapshot_observed_at":"2026-07-06T20:09:14.917734Z","submitted_at":"2024-12-18T12:50:11Z","title":"M$^3$-VOS: Multi-Phase, Multi-Transition, and Multi-Scenery Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13803","snapshot_observed_at":"2026-08-01T11:55:09.339686Z","title":"M 3-vos: Multi-phase, multi-transition, and multi-scenery video object segmenta- tion.arXiv preprint arXiv:2412.13803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.339686Z"},"links":{"cited_paper":"/paper/2412.13803","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:f475e0b10204a3e5a27a406ebb2baf950b72fd8feac6c7ab2abdf1668015592e","observation_id":"3c0ee510-43d0-4c02-bca7-0cfd347a7992","resolution":{"observed_at":"2026-08-01T11:55:09.339686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.408481Z","title":"Xmem: Long- term video object segmentation with an atkinson-shiffrin memory model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.408481Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:fbb705a6eef0d403ed7736c0ddf6e682036d25411056548955f5a07d4692b380","observation_id":"b5640434-1815-46e7-b2a9-37655da1d503","resolution":{"observed_at":"2026-08-01T11:55:09.408481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.505478Z","title":"Putting the object back into video object segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.505478Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:2571e5108375b184afb1947a908a67b380fff68210d7dde15cd5b445dbd154cb","observation_id":"8415628d-5e06-4aa9-bd55-1fd8f9745b56","resolution":{"observed_at":"2026-08-01T11:55:09.505478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.566402Z","title":"Rescaling egocentric vision: Collection, pipeline and chal- lenges for epic-kitchens-100.International Journal of Com- puter Vision, pages 1–23, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.566402Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:0d7a3435d83f9b70d44285a35f4eea7cd0b698139c44601c108484ec2a8219e8","observation_id":"06867b1c-c752-490a-ab56-af9a01d8e778","resolution":{"observed_at":"2026-08-01T11:55:09.566402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.630682Z","title":"Mevis: A large-scale benchmark for video segmentation with motion expressions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.630682Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:259c855b1f6019fe28bda3946ff6b43c519e91431888ac78c1576ea1201aaf41","observation_id":"6ad58e50-ad8e-45d7-a97c-3031da828713","resolution":{"observed_at":"2026-08-01T11:55:09.630682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.728034Z","title":"Mose: A new dataset for video object segmentation in complex scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.728034Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:0bec27ac7cdb53e9ddcdfd74496f74933b8bcabd4daf4a57d498efbb8860ad0c","observation_id":"b3210be7-1fc1-44cb-8a6b-97d1e8fbd8ec","resolution":{"observed_at":"2026-08-01T11:55:09.728034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16268","last_updated":"2025-07-29T00:08:01Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:19Z","title":"SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16268","snapshot_observed_at":"2026-08-01T11:55:09.781555Z","title":"Sam2long: Enhancing sam 2 for long video seg- mentation with a training-free memory tree.arXiv preprint arXiv:2410.16268, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.781555Z"},"links":{"cited_paper":"/paper/2410.16268","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:0f4c71cd38883f8fa340ad9f0a1a1aa2b5aacdc5b49a7206923e13799a99556a","observation_id":"d79a414a-a323-4915-86b1-432bf5a333f6","resolution":{"observed_at":"2026-08-01T11:55:09.781555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.843883Z","title":"Event neural net- works","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.843883Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:11a27abdce6be379c2626d5273fc18d59bd9ae18c5d73fc4df8d76d3bdf955d5","observation_id":"1bb0a664-994b-4eed-a5ec-ee91f146312c","resolution":{"observed_at":"2026-08-01T11:55:09.843883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.906884Z","title":"Lasot: A high-quality benchmark for large-scale single ob- ject tracking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.906884Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:4aec02e9255ec68f7e6e1c528bc5bd07c817745fc41e3eae59de37540d71313f","observation_id":"b9d6d769-d358-43b4-8a41-0d8bd77a3d0f","resolution":{"observed_at":"2026-08-01T11:55:09.906884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.969824Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.969824Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:c7d8a6448bbf19c0cd4dece2efc6a20f3fbe5128ee6ead2a3e0fa2bd7c1e25bd","observation_id":"c55b2d4c-06b9-40a2-8e82-f074a17953ff","resolution":{"observed_at":"2026-08-01T11:55:09.969824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.029885Z","title":"Skip-convolutions for efficient video processing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.029885Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:b744a60363085accf5b17176bafc5f788630ebf82d37a6fcb07c3b974e7d9ba4","observation_id":"cf7417b5-1c2b-4e13-a5d0-8108c94a0fe8","resolution":{"observed_at":"2026-08-01T11:55:10.029885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.118570Z","title":"Delta distillation for ef- ficient video processing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.118570Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:5e36bb7cdb864e61e3ad583b4e94e4bc65440f1a2005de877e6a5f4dbb4899a4","observation_id":"42246b8d-38a3-45d2-81ba-a90e3430637d","resolution":{"observed_at":"2026-08-01T11:55:10.118570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.180497Z","title":"Lvos: A benchmark for long-term video object segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.180497Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:6aca02c15f6d12ce87c5fcd4189e2c912a7d98956839365d113140ab101e154d","observation_id":"9ccf52b5-cc15-4253-9e1a-6bd0739cda0e","resolution":{"observed_at":"2026-08-01T11:55:10.180497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.249402Z","title":"Videomatch: Matching based video object segmentation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.249402Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:6a649aa55aa893ffeb04a7a17eae88e919cca0c12ecc33856d8777bfe1b3835e","observation_id":"c0c76a2c-6dcb-4f24-a423-ca16ba7b9eb3","resolution":{"observed_at":"2026-08-01T11:55:10.249402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.314385Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.314385Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:501e41a90c7b008a028367a55ae73bc547532127b6e7e9455bd436eb7728a21f","observation_id":"e9e8e9bd-b887-4b80-8ed9-2bc1e909a785","resolution":{"observed_at":"2026-08-01T11:55:10.314385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.410233Z","title":"Scsampler: Sampling salient clips from video for efficient action recog- nition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.410233Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:432a05a01222d0acdc05150d4c970bb7cc1ebc7100b16e86f40dbe43061f9fb4","observation_id":"e1b6792d-842c-48cd-9e2f-6be9074661c1","resolution":{"observed_at":"2026-08-01T11:55:10.410233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.480170Z","title":"Blade: Learning compositional behaviors from demonstration and language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.480170Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:cdcd46b6a20752a3975c48431278ae83dfbcf825435079a81d4254a1af3faa4b","observation_id":"7f854cbd-ced3-4689-84bb-6a20a77ac05e","resolution":{"observed_at":"2026-08-01T11:55:10.480170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.512238Z","title":"Mash, spread, slice! learning to manipulate object states via visual spatial progress.arXiv preprint arXiv:2509.24129,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.512238Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:b894ff92e4e1b37b92bae2e1f8fbe09b5b20df4762877e96daa0371f71fb117e","observation_id":"97000b2f-58c0-4844-b857-06b78ca5da5c","resolution":{"observed_at":"2026-08-01T11:55:10.512238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.562673Z","title":"Spoc: Spatially-progressing ob- ject state change segmentation in video, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.562673Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:fefce8a91b78a8a7ac45e9ee132aa4479586c5b5ee22837ae18826e621368f7a","observation_id":"1abb384b-a092-4b2b-bb3b-0d78c57a9c43","resolution":{"observed_at":"2026-08-01T11:55:10.562673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.627825Z","title":"Video object segmentation without temporal information.IEEE transactions on pattern analysis and machine intelligence, 41(6):1515–1530, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.627825Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:fe19df55cfa6fd34f9c411d9f2dc07388e11322359baa5b3b9ec4f27bf2997ec","observation_id":"43e75ae2-a3c9-49ee-866d-ce714d551207","resolution":{"observed_at":"2026-08-01T11:55:10.627825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.697849Z","title":"A literature review of computer vision techniques in wildlife monitoring.IJSRP, 16:282–295, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.697849Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:06dfa6b31e152482a8cd95d68d59c4e8b236dc6e941721641d57d2d704c1482c","observation_id":"f4e8230c-3053-4ebf-81ee-e0a77fd10d6b","resolution":{"observed_at":"2026-08-01T11:55:10.697849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.819325Z","title":"Fast video object segmentation by reference- guided mask propagation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.819325Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:a01a8cf3364fdd258cd4fc025d7910baa12137564c175c18ba295bc2c18cf478","observation_id":"4dec266b-5741-45fe-a0ee-153461296471","resolution":{"observed_at":"2026-08-01T11:55:10.819325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.876734Z","title":"Video object segmentation using space-time memory networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.876734Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:a51043b568ad5da4009320043c9b365d0b518ed0e954b773851db55de0232dae","observation_id":"b5f1dfd1-4ef5-43f1-8661-a7a5c4a4d484","resolution":{"observed_at":"2026-08-01T11:55:10.876734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.924605Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.924605Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:c2fd9735871273667c4effdbd10e3d20d1e01016d33a19214f7e4064d572fcfa","observation_id":"44e2774a-b9d6-4397-a82a-2f4f82a31b07","resolution":{"observed_at":"2026-08-01T11:55:10.924605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-01T11:55:10.968087Z","title":"The 2017 davis challenge on video object segmentation.arXiv preprint arXiv:1704.00675, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.968087Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:479e803dcb7e8f3c44e9b01d2ae81e91157b0fa81ed7a717240cc597f6915e1b","observation_id":"df4682ff-61ed-47fd-bc68-4518d44c06ad","resolution":{"observed_at":"2026-08-01T11:55:10.968087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05776","last_updated":"2023-04-02T22:01:17Z","snapshot_observed_at":"2026-07-31T08:06:57.921225Z","submitted_at":"2022-11-10T18:58:22Z","title":"High-Quality Entity Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05776","snapshot_observed_at":"2026-08-01T11:55:11.059687Z","title":"High-quality entity segmentation.arXiv preprint arXiv:2211.05776, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.059687Z"},"links":{"cited_paper":"/paper/2211.05776","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:6a18c52474ae6d51c441d5e36a1154466efab841d51ea52240486e5079462823","observation_id":"a71abc44-b18f-4f1a-93b6-089704796abd","resolution":{"observed_at":"2026-08-01T11:55:11.059687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-01T11:55:11.215307Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.215307Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:01d7296e05e6404e6aea313a08bb3575049dd83182cde44df723ace4fb00a351","observation_id":"be2f7887-fd6f-4462-b7f4-701fea1dfcef","resolution":{"observed_at":"2026-08-01T11:55:11.215307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:11.297776Z","title":"The visual object track- ing vot2016 challenge results","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.297776Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:0b0dbe54899176b0329d1da15f4a6da83a47b4b19878652fc5c13278286835a5","observation_id":"960e87ca-f89a-4aff-888b-b24522c9c274","resolution":{"observed_at":"2026-08-01T11:55:11.297776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:11.392497Z","title":"Token turing machines","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.392497Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:ac381a1fdfb024aaeb10406a8689eceee82c5e2f947aaaa62f972c9ff547e513","observation_id":"707e97e6-c2cd-47d9-8648-db51a93f14b2","resolution":{"observed_at":"2026-08-01T11:55:11.392497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-01T11:55:11.477753Z","title":"xgen-mm-vid (blip-3-video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.477753Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:d92b6f66eecdfa1edb5e43e4bb4e614d545b74c0b612c866b0d287e633b9834f","observation_id":"a8f4a119-5ef0-4545-87e6-4b6fc4e5ed8a","resolution":{"observed_at":"2026-08-01T11:55:11.477753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:11.568889Z","title":"Tracking and understanding object transformations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.568889Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:907fefce0bd554fd394acc60794c404687a58216c299c91ce7cffeaba799e0f1","observation_id":"8d0d70f6-8b79-4828-9a3d-1282ef858430","resolution":{"observed_at":"2026-08-01T11:55:11.568889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:11.660021Z","title":"Breaking the” object” in video object segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.660021Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:6a475252e76b1e5fd4d908813f89051a49ebc871913746b297f49071b716fa28","observation_id":"7d43954b-31a3-4899-a24f-12ad72049d98","resolution":{"observed_at":"2026-08-01T11:55:11.660021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:11.747593Z","title":"A distractor-aware memory for visual object tracking with sam2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.747593Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:e9e12332a7d74a20c3d0e945054d093d4deb233c035bba010528b239f916a9a8","observation_id":"26ec42ed-9de2-4b06-9d66-b9495243f4e4","resolution":{"observed_at":"2026-08-01T11:55:11.747593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:11.840339Z","title":"Feelvos: Fast end-to-end embedding learning for video object seg- mentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.840339Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:dd21ef6177341f314bc892ba6f3bd62bc31699377d266b11514dc4d6ba2e84ec","observation_id":"929525fd-87d9-4908-b8bc-153174901eec","resolution":{"observed_at":"2026-08-01T11:55:11.840339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:11.946785Z","title":"Adaptive focus for efficient video recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.946785Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:3238b74ff7d4fe3c81cd23e4c2e5ed2c9748f2f36e8c94b1b2bd5455bbcb08c1","observation_id":"7dfe8420-5782-4432-a505-6d00eefaabcf","resolution":{"observed_at":"2026-08-01T11:55:11.946785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.029372Z","title":"Tracking transforming objects: A benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.029372Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:8c38194cdb2fe987d3b4b7631eeb8cf9d53364dc65716fa1bd6710a78c44738d","observation_id":"a47d4fdb-b372-4ce7-9317-ad3716e16f49","resolution":{"observed_at":"2026-08-01T11:55:12.029372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.115537Z","title":"Adaframe: Adaptive frame selection for fast video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.115537Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:320a341def9b9f43fa9c8307620271880e1bc827ceb6f503c14f1bf0db589fb3","observation_id":"111fb18e-add2-4f83-a643-915daa82f3a9","resolution":{"observed_at":"2026-08-01T11:55:12.115537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.213919Z","title":"Efficient track anything","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.213919Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:b0e4f2ade9fe50bd8d3d8e2d59faf30b4e5567d0f436151b4deeb46ce7264eb3","observation_id":"03865801-13f9-4caa-a751-e859f728910d","resolution":{"observed_at":"2026-08-01T11:55:12.213919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.303996Z","title":"Youtube-vos: Sequence-to-sequence video object segmentation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.303996Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:dee77875b554070445b803d417983b692d94bb8c5b761bf63d35a73dfd672af7","observation_id":"5ce48b93-8211-4296-970d-707ed72f4c5d","resolution":{"observed_at":"2026-08-01T11:55:12.303996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.401325Z","title":"Learn- ing object state changes in videos: An open-world perspec- tive, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.401325Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:90f8fc8362bae03cc165f3f2a7e63cf4a3c9da2120933e931999db2fe469f360","observation_id":"73299579-45fd-4bc9-889a-da9246eb8647","resolution":{"observed_at":"2026-08-01T11:55:12.401325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11922","last_updated":"2024-11-30T22:32:34Z","snapshot_observed_at":"2026-08-08T21:51:38.855361Z","submitted_at":"2024-11-18T05:59:03Z","title":"SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11922","snapshot_observed_at":"2026-08-01T11:55:12.500740Z","title":"Samurai: Adapting segment anything model for zero-shot visual tracking with motion-aware memory.arXiv preprint arXiv:2411.11922,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.500740Z"},"links":{"cited_paper":"/paper/2411.11922","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:962beae296430725a6684703bf6f2e9d6363f1d1eb0733593edf2d06fffa74d1","observation_id":"e7e59353-1601-43bf-a8ba-dfaa5d970eaa","resolution":{"observed_at":"2026-08-01T11:55:12.500740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.593019Z","title":"Efficient video object seg- mentation via network modulation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.593019Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:62bc0b6479a41e230713dd7ff2c44ac03b1341e92066621e61d24334b21d017b","observation_id":"ad64c713-bd2c-4008-b0a8-bda4da06154e","resolution":{"observed_at":"2026-08-01T11:55:12.593019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.691476Z","title":"Collaborative video object segmentation by foreground-background inte- gration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.691476Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:02da613c1ca0e80da8afa0f7381d2582fbd3a9f8a3149b47f8b7d793ee3ae052","observation_id":"eb79461b-0af3-4626-a540-5a30c843f777","resolution":{"observed_at":"2026-08-01T11:55:12.691476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.792068Z","title":"Associating ob- jects with transformers for video object segmentation.Ad- vances in Neural Information Processing Systems, 34:2491– 2502, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.792068Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:e82490a2705861312a643718f6859e8b2c16ae6f80bdd5f57da6a8d278b53871","observation_id":"a9e80751-2f38-4a99-b663-7556db8d9e0b","resolution":{"observed_at":"2026-08-01T11:55:12.792068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.884011Z","title":"Video state-changing object segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.884011Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:bca4c5f357d430e1bd626c27ff3da9048703a5664566a686dd744287dcd5fd83","observation_id":"f312575e-f5a8-4706-b840-366e5e12a8ef","resolution":{"observed_at":"2026-08-01T11:55:12.884011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.936381Z","title":"Convolutions die hard: Open-vocabulary seg- mentation with single frozen convolutional clip.Advances in Neural Information Processing Systems, 36:32215–32234,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.936381Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:a2c8d3071760f5f1130efbb466066523917b5acafcdce7f7d69c2ae4965e84b2","observation_id":"0fe1e955-8f06-46ef-9fbd-8dcccf533950","resolution":{"observed_at":"2026-08-01T11:55:12.936381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22779","last_updated":"2026-06-03T09:11:47Z","snapshot_observed_at":"2026-08-02T20:38:33.149530Z","submitted_at":"2026-02-26T09:15:34Z","title":"TrajTok: Learning Trajectory Tokens enables better Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.22779","snapshot_observed_at":"2026-08-01T11:55:13.026221Z","title":"Trajtok: Learning trajectory to- kens enables better video understanding.arXiv preprint arXiv:2602.22779, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:13.026221Z"},"links":{"cited_paper":"/paper/2602.22779","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:0580303186e4e39e1452e93498a6509704eba5dc35cdd1c071bcaa80bc3f0d24","observation_id":"bcdb979b-3065-4091-bddc-b9c315c73e2d","resolution":{"observed_at":"2026-08-01T11:55:13.026221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:13.116562Z","title":"Edgetam: On-device track anything model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:13.116562Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:4404e6c74c3a70fd3ce32f5c404443160047792276631aee1577e422a95b8b46","observation_id":"ad502b1d-f351-491c-b7ea-4401158d740a","resolution":{"observed_at":"2026-08-01T11:55:13.116562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T16:38:55.493918Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2607.19743."}