{"as_of":"2026-08-09T00:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d35ddb3ecc9b951da99f33a0dd0660398347f4cc7adb7efbc7639007b691d97","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:17:47.022013Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13421/citation-record","integrity":"/paper/2607.13421/integrity","json":"/paper/2607.13421/citation-record.json","paper":"/paper/2607.13421"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T05:17:39.096786Z","title":"arXiv preprint arXiv:2303.08774 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:39.096786Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:0798928603271079116109f8bc17d9a68b18df4f03407565a56838a7f5f88f05","observation_id":"bce00fdc-7986-4685-885a-3ac341e6a2e9","resolution":{"observed_at":"2026-08-02T05:17:39.096786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:39.159518Z","title":"In: ICCV","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:39.159518Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:fef8c6471261a54ce6f8a2066f50c5052aff640c5014500ed9d6f3d8ba92bde9","observation_id":"56b3b335-fe7c-481a-b9b3-4592bcad190e","resolution":{"observed_at":"2026-08-02T05:17:39.159518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:39.307561Z","title":"In: ICCV","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:39.307561Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:99aca4b21eded19115fad57f17f84aa2d729f8893a0e448e68a300732f948bc2","observation_id":"fffcc511-4cbe-4e95-a81d-6f627784c3b2","resolution":{"observed_at":"2026-08-02T05:17:39.307561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T05:17:39.479468Z","title":"arXiv preprint arXiv:2511.21631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:39.479468Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:341c1eb693f267913638ab0694075cff523d47918c766ac97d51553325061a0c","observation_id":"04ac3970-7b4a-4a7d-9a4f-801259c6d0df","resolution":{"observed_at":"2026-08-02T05:17:39.479468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-02T05:17:39.663567Z","title":"arXiv preprint arXiv:2106.08254 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:39.663567Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:fcf0ee882ad71c31252a00b161202e6b02312a12e26d5cd0b9658fbf66dbb1d9","observation_id":"8697d48f-f578-4fb9-a8c3-f6ec62328d30","resolution":{"observed_at":"2026-08-02T05:17:39.663567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:39.834142Z","title":"In: ICCV","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:39.834142Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:b2eaa4156c85d27460aadc8c7d75b7bd68db6585854ce359061dee36b701f490","observation_id":"cb7596d7-befa-411f-b099-1aebc97e5fb3","resolution":{"observed_at":"2026-08-02T05:17:39.834142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:40.021515Z","title":"In: ECCV","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:40.021515Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:3fd75d11489eb19b29dc59e8ebd961c74b5d8e37f383eb30121cac779608e74c","observation_id":"70f0c01c-5073-4f14-8748-b2c0945a8cdb","resolution":{"observed_at":"2026-08-02T05:17:40.021515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:40.191155Z","title":"In: WACV","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:40.191155Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:e2508d229adb8a8eab971c82f191cf38eae280965fd3d4c2c1041b4239dfeaef","observation_id":"ea028b39-321e-4507-abd9-9acd9ae96f91","resolution":{"observed_at":"2026-08-02T05:17:40.191155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:40.283064Z","title":"In: ECCV","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:40.283064Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:2604be3154b92cbc53d494750dcb9319bb0fa66662e897b5385718c2fa323a84","observation_id":"f927b9b4-d763-4058-ad52-0615401eb269","resolution":{"observed_at":"2026-08-02T05:17:40.283064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:40.405951Z","title":"Chen et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:40.405951Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:fb08af2ffa49b2cfd007626c53248ce2e0d41ca5881aeb11dc77c12f75096d81","observation_id":"d0f2c486-0e70-4e63-86ad-f3dc94ef2ad2","resolution":{"observed_at":"2026-08-02T05:17:40.405951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:40.564173Z","title":"NeurIPS34, 28442–28453 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:40.564173Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:6d74931bc1dadfd9cf1d506ef25996e1569f3587ba83b5a01533e0a276b14ed7","observation_id":"dff85100-7380-46b0-b12d-bc5a3b20f351","resolution":{"observed_at":"2026-08-02T05:17:40.564173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:40.714933Z","title":"TCSVT (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:40.714933Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:de78d676ee02733acdb1cb532d5ea87212c5eafd9294efd0d9bd81e597399a3c","observation_id":"f2ce36e5-bc24-4a4c-a23b-038724aebe86","resolution":{"observed_at":"2026-08-02T05:17:40.714933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:40.859781Z","title":"TPAMI (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:40.859781Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:9352013e92246d7f5bc6a0f265179953cdce96694a00bb8fa61efefce12c820d","observation_id":"74fad117-945d-42ae-855b-c5f7cbcec15f","resolution":{"observed_at":"2026-08-02T05:17:40.859781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:40.975393Z","title":"In: ICCV","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:40.975393Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:945e63821ac526e3ec85612a1f899fe3f54910bbe0986a4c8abe31b607bc4c3a","observation_id":"fbfc2b56-d228-4b02-9781-cb0f45497a71","resolution":{"observed_at":"2026-08-02T05:17:40.975393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:41.087192Z","title":"NeurIPS37, 121670–121698 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:41.087192Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:494d03cb99ec8d3f941f8da1da005d9460cc82ffb509c4033f9d8b2b3e0525c3","observation_id":"86077990-35d4-4812-85bc-e1b74e19382a","resolution":{"observed_at":"2026-08-02T05:17:41.087192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:41.238768Z","title":"arXiv preprint arXiv:2510.09274 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:41.238768Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:97f326a465528400a84fe5a5abfc82bfe2d7b076814dc25e586b0f9502ff7cc5","observation_id":"07180e20-0350-4de4-a1a9-00e6c3a3e94c","resolution":{"observed_at":"2026-08-02T05:17:41.238768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:41.382381Z","title":"In: ICCV","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:41.382381Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:8b7b5954314e35c7ba58d0f1e74378af2c34361e07990f52f6238b64f397f1e2","observation_id":"0ffa4f0b-e9c3-4e6f-b946-850a3e492767","resolution":{"observed_at":"2026-08-02T05:17:41.382381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:41.568196Z","title":"In: CVPR","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:41.568196Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:15b8f630af6d512581b174df893f1781d0f11ca73890ca08c8b14ee9b7b211ba","observation_id":"c4c6eadf-ca31-43d6-af6b-5b5b0bf2afaa","resolution":{"observed_at":"2026-08-02T05:17:41.568196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:41.672525Z","title":"In: CVPR","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:41.672525Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:761c53af4e244ca1d407318093bcbfd2e72d3685bbc2d295a70599f154c05a65","observation_id":"5f80730b-f7e7-4cb2-9f6c-a291497d1aa4","resolution":{"observed_at":"2026-08-02T05:17:41.672525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11168","last_updated":"2025-02-16T15:38:33Z","snapshot_observed_at":"2026-08-07T18:14:38.620698Z","submitted_at":"2025-02-16T15:38:33Z","title":"Knowing Your Target: Target-Aware Transformer Makes Better Spatio-Temporal Video Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11168","snapshot_observed_at":"2026-08-02T05:17:41.794200Z","title":"arXiv preprint arXiv:2502.11168 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:41.794200Z"},"links":{"cited_paper":"/paper/2502.11168","citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:1bf057ecee872d277c4b12e6bb87cbfa492ade058fa0003356e18e18c6483029","observation_id":"17ded26d-5018-4dd5-af56-21810e6032ed","resolution":{"observed_at":"2026-08-02T05:17:41.794200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:41.935783Z","title":"arXiv preprint arXiv:2511.21375 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:41.935783Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:e4475d3a5a74d2524308780fbc8d41d543b017320006b6e77acc7d42d588761f","observation_id":"fb8ce704-8bf2-421d-933d-c4ffb203fab2","resolution":{"observed_at":"2026-08-02T05:17:41.935783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T05:17:42.055938Z","title":"arXiv preprint arXiv:2501.12948 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:42.055938Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:ff0ad4fac900ed37be5591d33621dfc95bd52c9c6eb2265663fbca8b398e9f6e","observation_id":"e7ea3c9f-5bb8-48e2-978e-96ec6f2459a8","resolution":{"observed_at":"2026-08-02T05:17:42.055938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-02T05:17:42.165867Z","title":"5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:42.165867Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:58f37f2faca131da67c705f5ae2b2f5f4e146476917fe349c4590aaafac33d9e","observation_id":"70b87539-3223-4dfd-a4e8-be4a7401e44e","resolution":{"observed_at":"2026-08-02T05:17:42.165867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:42.285710Z","title":"In: ECCV","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:42.285710Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:9a4e3a47af34c83e9cd4c1c2945f25b4ba75b6f0a333d4c7834f100f0d0edd5e","observation_id":"ea60af27-848d-4dc0-aa7c-c1f7fe55f970","resolution":{"observed_at":"2026-08-02T05:17:42.285710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:42.437338Z","title":"In: CVPR","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:42.437338Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:61ba49ca5a0980340233a800af63f88ab28db1d57710b4cd10374aa120f2e0db","observation_id":"a511c4cc-8283-4071-96a5-8949f2af4a19","resolution":{"observed_at":"2026-08-02T05:17:42.437338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:42.527596Z","title":"NeurIPS35, 29192–29204 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:42.527596Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:e4a3ccfa33dbaa79c9ef5144ac6e1729b34dca27aaad3da4724fc37507fd526e","observation_id":"2092d07f-4e57-4af6-9d6a-a0ea7fe82cd0","resolution":{"observed_at":"2026-08-02T05:17:42.527596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:42.605078Z","title":"In: ICCV","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:42.605078Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:0e5c0e9b5953563dd663cb8f717a4efda844e36f9fe3140b320838135750e240","observation_id":"2a6e2998-b0da-4cae-939e-763d6786a99d","resolution":{"observed_at":"2026-08-02T05:17:42.605078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:42.718826Z","title":"In: ECCV","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:42.718826Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:9f76c7c7e0d183d94c9307d981fdf53676200ff5e62cacae8e6811f69f8410f8","observation_id":"f02887a4-993c-4f0d-9cce-9725f2e468ba","resolution":{"observed_at":"2026-08-02T05:17:42.718826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:42.859875Z","title":"NeurIPS34, 11846–11858 (2021) ScanFocus: A Coarse-to-Fine Framework for STVG 17","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:42.859875Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:267b864456e93a35debb26db34fca2ae5a728941f2011c961025d64810d1bf7f","observation_id":"3b75e24d-8bfc-402f-ab70-930e72108dd1","resolution":{"observed_at":"2026-08-02T05:17:42.859875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:43.037933Z","title":"In: CVPR","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:43.037933Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:83e50814e3562ecf96cf5264806559a5a45b745615b3d0216fe02d4a052199c8","observation_id":"4bfba24c-2ee2-403c-ba0a-2fcc4b01b495","resolution":{"observed_at":"2026-08-02T05:17:43.037933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:43.193557Z","title":"IEEE transactions on medical imaging43(1), 96–107 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:43.193557Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:0f6eaed754d59b7c09019cdeca4da9eb2802a88375770ec3eea35f96c69eb362","observation_id":"1391d910-287b-489d-acb0-a217d7bd76cc","resolution":{"observed_at":"2026-08-02T05:17:43.193557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:43.313101Z","title":"In: ICCV","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:43.313101Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:dbf938039b7d4c0a3080ee7e1c89dc09fd4b8e1e54cdb7f35e1f595347a9f1f3","observation_id":"91efcafc-e575-4ddf-8871-044421af8dde","resolution":{"observed_at":"2026-08-02T05:17:43.313101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:43.436505Z","title":"In: CVPR","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:43.436505Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:d9560808809033c4d21b3e7ea689d92538c94ac469e0863143837e64ec3ac4fe","observation_id":"a43a8f1c-e8f6-4fb2-98ba-c9e319a55292","resolution":{"observed_at":"2026-08-02T05:17:43.436505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:43.581486Z","title":"In: ECCV","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:43.581486Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:8b7f12494bdb9b089bea28edd46a8d477e8a638855216294c44725372c7b4815","observation_id":"62aa8eb0-9b51-4253-8b78-b214b2fb319d","resolution":{"observed_at":"2026-08-02T05:17:43.581486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08835","last_updated":"2024-07-03T18:05:02Z","snapshot_observed_at":"2026-08-04T18:08:42.450729Z","submitted_at":"2023-11-15T10:22:35Z","title":"Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08835","snapshot_observed_at":"2026-08-02T05:17:43.721458Z","title":"arXiv preprint arXiv:2311.08835 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:43.721458Z"},"links":{"cited_paper":"/paper/2311.08835","citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:18638d980de81519bffa3d02d047087cb7e4899a9a3dd19aac31bbfd607bf4c9","observation_id":"633ecaa7-960f-410a-bb1a-b5a1dfa67c29","resolution":{"observed_at":"2026-08-02T05:17:43.721458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:43.841313Z","title":"In: CVPR","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:43.841313Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:3dbd09e925cb10bb665d4ac3362e4f7052c48596ccb7820178d5f681eff560d5","observation_id":"5d430845-3463-408d-8b86-c14b28184ec0","resolution":{"observed_at":"2026-08-02T05:17:43.841313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:43.958043Z","title":"In: CVPR","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:43.958043Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:09d16a906bd2f5e28a74d586fe341d8ede0c50253a0ead32bf308a920c24f1ef","observation_id":"e91696a6-37f8-4e1e-a3fd-34901271d027","resolution":{"observed_at":"2026-08-02T05:17:43.958043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:44.036849Z","title":"In: CVPR","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:44.036849Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:747c826899cfd574cc7b67718d89e5d0ef2bcc0b8bc82c4caf18c0f94fcb4d72","observation_id":"248b5e85-54e8-49e4-8439-d6c13b63b94f","resolution":{"observed_at":"2026-08-02T05:17:44.036849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:44.215895Z","title":"In: ICCV","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:44.215895Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:948619fa5eb8487cec0ce1a4d922d9a773f8bb64243d5d96aa9dab7a03df631a","observation_id":"4f1189d7-dc7b-4e42-9316-7538e753655f","resolution":{"observed_at":"2026-08-02T05:17:44.215895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:44.305497Z","title":"In: ICCV","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:44.305497Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:4143ab71e377c97973583f81a85439d6776808549ef4da3b7850ceb8c28b3c95","observation_id":"b84e8799-72d9-4cae-a1c5-4827fec583b4","resolution":{"observed_at":"2026-08-02T05:17:44.305497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.10634","last_updated":"2022-05-05T07:32:13Z","snapshot_observed_at":"2026-07-06T11:21:03.451236Z","submitted_at":"2021-06-20T06:35:40Z","title":"Augmented 2D-TAN: A Two-stage Approach for Human-centric Spatio-Temporal Video Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.10634","snapshot_observed_at":"2026-08-02T05:17:44.381877Z","title":"arXiv preprint arXiv:2106.10634 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:44.381877Z"},"links":{"cited_paper":"/paper/2106.10634","citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:8490d25b3b49124eb0884e9b9b19a55b75d356eb63d21781220e889394f6c6d1","observation_id":"4b42ed6e-1f69-4ac5-98be-1b9421207f4e","resolution":{"observed_at":"2026-08-02T05:17:44.381877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:44.548749Z","title":"TCSVT32(12), 8238–8249 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:44.548749Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:0e2a7b64fa02dd11229a0a4bd31214cb2eec832e203f5854ea31d288f11a9868","observation_id":"4f3c1bbe-7f2e-4ad6-830c-ed2a24a2b8ea","resolution":{"observed_at":"2026-08-02T05:17:44.548749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:44.650534Z","title":"NeurIPS35, 10078–10093 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:44.650534Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:bcf5fcb5767b693ea1d6f7fc50759a46a91c1169934165888dac0739787f4aed","observation_id":"2ef85720-1114-4d63-be36-7eb41c8e011c","resolution":{"observed_at":"2026-08-02T05:17:44.650534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:44.766279Z","title":"NeurIPS30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:44.766279Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:6741146887d379f748109eb8e20f8883d61281d04777f80260f4f221306cf1c1","observation_id":"d402bc82-b25d-4bad-9c9f-1173066318f8","resolution":{"observed_at":"2026-08-02T05:17:44.766279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13983","last_updated":"2025-04-11T05:22:55Z","snapshot_observed_at":"2026-08-07T16:55:40.606991Z","submitted_at":"2025-03-18T07:40:36Z","title":"SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13983","snapshot_observed_at":"2026-08-02T05:17:44.897525Z","title":"arXiv preprint arXiv:2503.13983 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:44.897525Z"},"links":{"cited_paper":"/paper/2503.13983","citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:634ba524aab4ad40ca0a1e020eecd953588a0f75ed0ba261665adb53b46eb0ee","observation_id":"dc37d913-647b-4a08-b324-53b57bf945ee","resolution":{"observed_at":"2026-08-02T05:17:44.897525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:44.972677Z","title":"In: CVPR","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:44.972677Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:b71c490aeb0b42e52f8248cd0ab3f54ee300c6f2bb895a485f4196974462dbc7","observation_id":"8759f66a-83b3-4a91-a558-4c509a1e19ba","resolution":{"observed_at":"2026-08-02T05:17:44.972677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:45.054602Z","title":"In: ACMMM","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:45.054602Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:0c164be1aa61e72855ce73c4dafac017212cc403399efad1717d4c647be308a7","observation_id":"d3481a49-e06b-42db-b1af-a13c5b8856e7","resolution":{"observed_at":"2026-08-02T05:17:45.054602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:45.112372Z","title":"In: CVPR","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:45.112372Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:fbb69d86c061376e33aab0209b55867bacb13ecd57a9cdb8f962313bbca73699","observation_id":"af2658b8-168c-4d1e-b088-82f8d523a586","resolution":{"observed_at":"2026-08-02T05:17:45.112372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:45.203736Z","title":"In: AAAI","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:45.203736Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:56a6195087e804722315466ba83a4f562b299f2a5245d7be0d53272f1d422a3f","observation_id":"a1663ef7-0790-48de-a90a-d1dfa8c091e1","resolution":{"observed_at":"2026-08-02T05:17:45.203736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:45.301585Z","title":"In: CVPR","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:45.301585Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:2b639b03bc97f64783a9140d37fd9e3642df7eaf24fe774d9e5525f4d160cbcf","observation_id":"f47ade2c-c816-4c00-aecc-5090a1676721","resolution":{"observed_at":"2026-08-02T05:17:45.301585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:45.452568Z","title":"In: ECCV","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:45.452568Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:4e1c0b349b62445eadbb93141c9aae7c8f20ff22f8416546724b5de5906375cc","observation_id":"c097ae7e-8a10-4049-ae4f-60ed5d11d1dc","resolution":{"observed_at":"2026-08-02T05:17:45.452568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:45.538491Z","title":"In: AAAI","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:45.538491Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:480b569c795be978578f6511d3f18baf38edc778745b6046d3498eaf5e4912d7","observation_id":"e73b660a-ce54-4aa4-b79e-17f59402b661","resolution":{"observed_at":"2026-08-02T05:17:45.538491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:45.677072Z","title":"In: CVPR","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:45.677072Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:0bf185d286de6b5c14de166ea93338462c43bd1d101415fa566083ef6d9b0a4c","observation_id":"e73249df-0c27-437b-a006-1f356d2854c1","resolution":{"observed_at":"2026-08-02T05:17:45.677072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:45.777515Z","title":"In: CVPR","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:45.777515Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:c3c51b437ed9de185b186d63b866505296477876ee3a99dd01b9e998aa501e9b","observation_id":"533acf56-4a6f-4539-a65f-eef1bc03081a","resolution":{"observed_at":"2026-08-02T05:17:45.777515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07166","last_updated":"2021-06-14T05:18:34Z","snapshot_observed_at":"2026-08-05T23:15:31.498606Z","submitted_at":"2021-06-14T05:18:34Z","title":"2rd Place Solutions in the HC-STVG track of Person in Context Challenge 2021","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07166","snapshot_observed_at":"2026-08-02T05:17:45.903712Z","title":"arXiv preprint arXiv:2106.071663(7) (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:45.903712Z"},"links":{"cited_paper":"/paper/2106.07166","citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:8f6a9c6471170ff4e137eca1477719f5af438a8a3d1aefb88716eb15fa80df0a","observation_id":"8d38f1f0-76ef-4a0d-8297-c4c54d19845d","resolution":{"observed_at":"2026-08-02T05:17:45.903712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:46.092194Z","title":"In: AAAI","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:46.092194Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:a54e2e32693260c41284bf6c7f967fe3595bf3e29327de567c1a9702f5d36b7b","observation_id":"c0885fc8-ae96-4c6f-bb83-3c209acb3f7b","resolution":{"observed_at":"2026-08-02T05:17:46.092194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:46.225036Z","title":"In: CVPR","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:46.225036Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:951925ed8c2c49df3748f908c825049eb5e945538327865c1633751fd34139cf","observation_id":"b7ebfe4d-e444-45b3-bdff-a587eca97c71","resolution":{"observed_at":"2026-08-02T05:17:46.225036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.06941","last_updated":"2020-08-22T11:11:32Z","snapshot_observed_at":"2026-08-01T19:16:06.824442Z","submitted_at":"2020-08-16T15:39:56Z","title":"Object-Aware Multi-Branch Relation Networks for Spatio-Temporal Video Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.06941","snapshot_observed_at":"2026-08-02T05:17:46.357529Z","title":"arXiv preprint arXiv:2008.06941 (2020)","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:46.357529Z"},"links":{"cited_paper":"/paper/2008.06941","citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:6f420b680820d1af2a93067170a27d29ea38860762d725f40945ac7c02119d7a","observation_id":"b5384dc5-75c5-4305-92b2-3f1b2d52ecbd","resolution":{"observed_at":"2026-08-02T05:17:46.357529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:46.502729Z","title":"In: CVPR","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:46.502729Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:d557ca069bb2dafe9cfd0f12863135087356eaef052780bab39ac4eae90a19f1","observation_id":"9f05630d-a843-4d86-a813-9f87112a3abb","resolution":{"observed_at":"2026-08-02T05:17:46.502729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:46.678128Z","title":"arXiv preprint arXiv:2602.13313 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:46.678128Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:7526e3860cae5a69db19e1a2e72157a95b78b182666a7589c59d8c4dda3f8763","observation_id":"fbc05517-7d50-4e30-86d6-ea086a89211f","resolution":{"observed_at":"2026-08-02T05:17:46.678128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:17:46.771301Z","title":"In: ECCV","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:46.771301Z"},"links":{"citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:b5b7606692a300758a1e4421747bcbb7ff41421d722beedbb8b49555050d94b2","observation_id":"5ba1d294-ebe0-4644-9933-fa8fbc3eed6e","resolution":{"observed_at":"2026-08-02T05:17:46.771301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-02T05:17:46.866540Z","title":"arXiv preprint arXiv:2504.10479 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:46.866540Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:b92d508fd9ac4597fae3a698bfebb8970a44a9a4d1ea068360088d48bc0a68f9","observation_id":"bdf53ae4-c518-48c1-b5d5-67657288b62d","resolution":{"observed_at":"2026-08-02T05:17:46.866540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-07-06T10:02:45.105181Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-02T05:17:47.022013Z","title":"arXiv preprint arXiv:2010.04159 (2020)","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:47.022013Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2607.13421"},"observation_digest":"sha256:3acc63cf969d1e6630617a3617782df64d36ca5e6efef5db54fa305ccbc967f6","observation_id":"3b6c098c-87ad-4fae-9f06-242326e05841","resolution":{"observed_at":"2026-08-02T05:17:47.022013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13421","last_updated":"2026-07-15T03:50:22Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T23:24:19.129691Z","submitted_at":"2026-07-15T03:50:22Z","title":"ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2607.13421."}