{"as_of":"2026-08-13T23:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e491f134b5b1d706b465e622944bb74fdc04d32860752e0f311a69caefc72c1f","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T06:06:47.233814Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.02922/citation-record","integrity":"/paper/2607.02922/integrity","json":"/paper/2607.02922/citation-record.json","paper":"/paper/2607.02922"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2303.08774 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:3608233b43031c3ce75ccff747db751bfa983183f020dedb2109faa22c1a3ab2","observation_id":"d4f6b78e-f922-41b3-abab-2b27e0411ec9","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:1412.69801412(6) (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:bf894838af94bba86c58140fe06a1c8ac905650cdc8fa49ab15f8bcfb84830df","observation_id":"fd14e178-fc05-4119-afee-5954dfb61084","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Machine Intelligence Research (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:19d8916db7e1caaf2e2a80c0716826924f3838f10af1fffa797834b7315bc331","observation_id":"a731ca61-a436-431d-9f5e-44dc3a6c75bb","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Machine Intelligence Research (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:97084c2ab01cbb3dfb5777006fff2d06b007d42bbdb49f51ab14856c74b9c988","observation_id":"b43e701c-f674-426e-b1be-b193255ae447","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2308.12966 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:0dd7c354d6a7cbc3fad6a4742e3a2d4bf068f33f31f7e6eaa6a7fcce508e480d","observation_id":"a985ebc9-90f4-4304-a321-f9f016748f5a","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:6ecf1e02dfae64789d61d58865493cf5ff68694b832afc3ca94f0d43ecb3857a","observation_id":"e9344be0-e3fc-440a-bf3a-297b14c07ac1","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-11T05:54:56.124984Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:1308.3432 (2013)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:a7e6b34f1e53bc00a3d3f844ae71ec290452ede00f6e0800d7948f7318e8fbc7","observation_id":"43e53513-0d5a-4527-b976-2a3b4b884d8c","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2210.09461 (2022) 16 Hesham et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:6a5c1d4fdd1d46ead0c6c4fc125ce7d6361d60d152be3552fdd9413bdf8bd567","observation_id":"286409b6-3575-4587-9819-987bf083cbab","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:2fe2762b6f9f47f0d022f37287cd96fbfcb0c833514beebf9f504bb0ca167de2","observation_id":"49536b96-5fe3-4f53-82ea-8fa6a26f86de","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09626","last_updated":"2024-03-14T17:57:07Z","snapshot_observed_at":"2026-08-13T00:54:03.001987Z","submitted_at":"2024-03-14T17:57:07Z","title":"Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09626","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2403.09626 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2403.09626","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:07fdb33a5f67d0fae4dff6af8623265cdb2f9d35a44f368df6abbd67952ef03b","observation_id":"60d65879-347f-4703-ae19-0bdd6bbc6dad","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ECCV","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:5a2d7c6091ddec139465954dd3496456e91b1dfd81f29abb240894651c156fe6","observation_id":"2273dcbc-1b9f-4414-873f-eea92e22b690","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2408.10188 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:77de2b757214b1accd45c1406ecc447113552ce9bc651e1dedc633811683f133","observation_id":"e5a4a78c-c2e6-4cd1-b2a9-ad8f673a58f8","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2312.14238 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:84a80aa44ed916b81ac3bdb03fc46243ed8e59cd118ec271506ff8e5bf0d66ba","observation_id":"ee914331-38a4-4e45-bce5-deeb1d576497","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2406.07476 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:a027b93d9099291e9fda602f4eaa3f75c066a6659c4195ad82e1a02f0be49989","observation_id":"2428d069-2089-40df-9b83-285c6c5ecf9e","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2405.21060 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:194f695ffdd2111eaf7079cd76b44cd569b6be310e2b2705e0750523316bd660","observation_id":"7c353ec4-af22-4fbb-a93c-8a486d8cfdcc","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICCV","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:af5e5ca56808774bd7f72528fcf954e6d0261c40a7f08d8b4f72f5fc3656b412","observation_id":"d83652dd-aaa0-4204-acaf-6e0c470f5855","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:cb28d4d042aa805d1993dc3ed1646a6298eda5043393ab21ec58c7284d36785d","observation_id":"86b087dd-01bb-4cd4-a2dd-e66afb5d88c4","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv e-prints pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:1e11efb5fc99809a4017a856a7406e62d74c6fa9fb3873c335f7fc0229afc73d","observation_id":"f6cd77ae-5788-4da2-ae8e-044d04b1e68c","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Machine Intelligence Research (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:0ec7b7ec713a7c8a59aecc9496f6c4d174d146559051e3d949488a025fe052e3","observation_id":"58980e28-8142-4b70-ada0-6d47a6e9d725","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:2d6bda523fe1370c80ea3e571f88e3285920e8bd7758392b89c1a6588cd0cbcc","observation_id":"839d4958-a5a6-42d6-90d3-5e302b800bc3","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:2ccfe4bc26c214c965d8b5351386f6f7eb532512b6370510c5e3e0207cd94724","observation_id":"28d79346-3a6e-4693-ba8c-432a47844da1","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: First Conference on Language Modeling (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:6af0963847d627174a168366eb85c1b511c83be258305c51ff27b8782b48a198","observation_id":"6d6050d8-1e45-4a09-b003-b4fc68496778","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:33ba06a21ff1bf0198cd27fb57f4551e4370f8d947610743a2ed21ea0430bd55","observation_id":"cf3a40f1-d2d0-42db-a3b5-6523e2ea6d9c","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2111.00396 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:c200614b5f786b15cd89386461e8db507cb12b342ae21b8dd6652c4e8de5e027","observation_id":"13095465-ae21-4a06-a09f-14e954dfa0d5","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICLR (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:769941db57b5b874865095c0b0f352f056941e540200600f8fa67cf780c0f108","observation_id":"39dc3970-31d6-4ab3-8225-8dac56440536","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:29bd3f8c3fba1d9c80f7322319d54559739e672ec347c77f543bca6478d52ef8","observation_id":"8be4e71c-fc84-401f-abc4-486ced89d171","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:3f6c9e45cd986c6cb9f44ea69a38a9b0011e6b87bed38a73066caeca284bbce8","observation_id":"7f46380b-9f22-48d3-85d4-b3e7202a9ec6","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Machine Intelligence Research (2026) STAC 17","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:110bf51f82067a551b7432d58aaa2bfb2c60b37a463e00326941ea4ae488c4d8","observation_id":"91864828-bab9-45e9-9bf7-a21edaed84d4","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:f8aa1dde8518eaeb1da755b403034f6d3ce663e569b432a847c96b79b6a7990c","observation_id":"0b37b6cf-bf96-4d8b-b8d6-9dacca63d7c1","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICLR (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:73b77e4b80f6b4793cbb1efaec03161252c9997025a4d3b2eb910b75abc18ddf","observation_id":"5f7d59a9-f7df-4e15-b2c1-8a903d976df7","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:be38773ace8525a27fd25fe39750afd544b84ff39c39633c69af4c2a66ca3854","observation_id":"66d601ba-6c07-44d3-af1e-3ff8c8562a84","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:bf56e6e028fb8ac969153830a39a7d7d1b5f2eeb7c31de84f9a2a92fc5ca41e5","observation_id":"5434a24e-294f-4761-a24c-9514f4e5b6b0","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:c8005a1400ba781dacaa04cf8354af601de5f6164fb008cbb450dce186855137","observation_id":"f8435b2d-3802-4302-800f-b4156d23f27b","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv:2401.04088 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:b4e41ec6a6806059bb56c3ad3ad552b72ce2c8eb00eb29bd36919000db9c1887","observation_id":"d95f45dd-7816-4adb-838a-ccf224d39e04","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2503.04130 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:c4dae724546c285607ef75a1b1c465b9b881a90875c0a8e58f236eaec210eac5","observation_id":"cb8fd7a6-1ec7-4bec-a92a-cc179f284e2d","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Journal of Basic Engineering82(1), 35–45 (1960)","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:1200d3be60843c4d885665b50d46d0a2b3c146e642798bde9d2620ce32ea79c6","observation_id":"b6c65628-7cc4-42a5-80d4-65265b56df39","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Computational Visual Media11(3), 655–667 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:9dc2902c811d4a33cf05a67ce8d85a7885e54494916a3b1ade3c9dbc951bd6bd","observation_id":"461e5042-f45e-45f8-8ec3-bbba9c00e7e7","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: Asian conference on computer vision","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:bcda6b67ed6d7edbce1e87836f73a47dd84b3796ddcf3a96f15515fa3fa85cef","observation_id":"07d234a6-566e-4f88-aab3-4927bb33ded9","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICCV","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:6aae96914d63d0ef75a89d8e16cdd098b50dc602e637b700e24b3a3c64f48b52","observation_id":"ad9c4785-e53e-4274-88b2-db8d0ad6a5df","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICCV","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:ed85fa3348798840c3887d2542fd2f4152e2a81c89f387eab0f2f19453025ba8","observation_id":"50c01312-37ba-4f83-9556-43bc100d8206","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:4e3db3d8a2f5a70a299279400054d69df5f817c390a7a8452d230645a76a9d76","observation_id":"44799c7f-5fff-4b2c-ae49-e3e226033daa","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2408.03326 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:37add7ce7e8c4b809ad7513a37034c81c135ee9a4c780df423d760c506821233","observation_id":"1a136f9a-79bc-4341-a9d8-7663fd96a47c","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ECCV","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:84cbc17e37288581113a7ae3fb85e04339d77ee01af55eae3bd9494d9e247f51","observation_id":"3be3c91e-b7b6-44b9-98fe-723c075550cb","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:3b1538e3c65cdb5c9ccd55d771287d06032e7c066ae09e6912213284e6343302","observation_id":"52ffdd98-43f9-447a-9a6b-11525769d7f8","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2311.10122 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:c9b9534448e7a68d2e2db1f64c21e846da71baf7d1c6d96b1c5c9e8287ce48d9","observation_id":"0aa1c8bd-29c0-4fc9-9186-2e06fef0cd9d","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:a4fe7b682ce10c1f29af10a77ef0417b69f1237389c0a9e314f39af7c2ba881b","observation_id":"fca6b943-2e8b-4f21-8027-042bedadfe68","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:0555cf9186d576076c7023f2fcd3a82df0e688f6aec6156d4a4af09d2c643f52","observation_id":"19bdcc5a-64fa-4aae-a66c-1a1086274fe5","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:9253af8fb2907e9442c72af893193e780fbf9a046f24fcede1d02b76af5ddd8b","observation_id":"e73b5dfc-90ce-4da9-bcaf-296b92770c4d","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"NeurIPS37, 103031–103063 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:c591030573dd739ea9e78e6e637675758c51513928442af1112afad75c040f38","observation_id":"fdd9ddd9-0a28-4f01-9f4d-50e2fbfc5cdf","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Machine Intelligence Research21(4), 670–683 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:6f4b52d67667d0675d9b91454e58c6386141e7cdd46254c686f89b1f94f40bdf","observation_id":"d14f4efd-bb8a-4503-ac09-5e79097118ee","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv e-prints pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:a557d6d5cc5bdb30fac2c313095560d10b230b551065cc6868f0efefa1b24f72","observation_id":"7b2ce9c1-ab38-4dd4-ba6f-2c5e01d42977","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:92b90e3d4145f9db366252d29d80d21a9351ed97c09cb7dd1a9b3fca02991a8f","observation_id":"fe4f295d-3fd1-4abb-9653-153300840e30","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: Proceedings of the IEEE/CVF Interna- tional Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:befa1c1641085cfb7d53f3dc790120f641d90a45e85c989bbf4a943314a6b637","observation_id":"a216cdec-57c7-42b8-b8f9-1d092d8cb6a7","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:d206aee01d81451f3d8712e058ddb8a88049ba886e164598dc882f5b6e67078a","observation_id":"a02ea75c-7acd-46fc-861e-5f796ca732c7","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Computational Visual Media12(1), 71–84 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:3bd43c86e7a58ad5bc391a757e06fa01b151ae1a181093b9bda84fcf00fdf188","observation_id":"3ce13bc8-a305-4cf6-b2b4-3c4e22d205cd","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:f5df9c11ce75d20e90f1e02669c1251e550c9dc7022c3130b135d5ae46c25e46","observation_id":"e57e284a-daf4-49c6-8eb7-e0d902de0f7a","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ECCV","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:2be2cd234d1b0d19c5ebd5583fa417821a08a6bf5bc22ee7fbd17f83ad8cf6ff","observation_id":"ce403898-ed40-42f8-a75f-c14eccd175b4","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: AAAI","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:4b0cfcaaa8f8a6f59cc0bcde72f784af061136e2e197e413c3c0c8c3e2947dcc","observation_id":"99e6b471-2162-4ab1-a085-5dd6ecea0bf9","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:1704.00675 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:617ead669c73fd2b500e87bcc94117e3882befc285b79a9b0c62b88a6824b931","observation_id":"e5a10d60-7622-49ec-be24-312751ef4129","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:43d4ccd41b2b304241dc3de593fcc616723a84d0f17aaf8bfc8e43da37af9182","observation_id":"75917728-ec17-4d9f-a731-f863bc70975d","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:bc52e12539aeca80b91a63b850f8433bc0aea8870b0ca6995068cf8b2793dfd9","observation_id":"6575c041-ef40-4a1d-a2bb-b7e44731f92f","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:e140c164e527b89f0cd4bd4efcb2268ffd10cd73de322f8b28c01f3b426eac94","observation_id":"622741c0-e100-44a9-9d93-a76f3c5d7186","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2408.00714 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:b7226f8ae0067ae6e30008133024ad772404859e9a1bc370979fb343d7397578","observation_id":"20f518b8-8b32-4cc0-9ed3-94ebeef0aa29","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ECCV","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:ec98341e2287b97563aa43784dfe3b161b7a1b14f84c1216abb45f9f147e2977","observation_id":"702d9478-8f9f-4295-8b22-b14605d92368","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-12T22:53:08.708305Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2409.01156 (2024) STAC 19","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:771830192b1a4a2357b701cf3991efa8b9f99acd8f2f1337a02a377e01bb16eb","observation_id":"54e0cb18-43af-407f-b79f-dc31dac84aca","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-08-13T11:36:11.821356Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2410.17434 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:05ea09bd21dca63a86c2fb37847c8fa659352d249ce433b5ba08e1f3ce38c78c","observation_id":"6b9a8a68-1aca-4181-a66f-ff7e7e52d9f7","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:13a483f634442b792085b2a485b2f10ef27d37e92c5259d8f1a08ed0338b929b","observation_id":"b695f4fe-31ef-4978-bec3-337a0f1036c8","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2508.04369 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:5a72b092a3dc2d1ff875133c604192658d5c2dc18407dc71f70426b92284a84c","observation_id":"c2dab446-ef64-436f-a05f-c75209fd2426","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICCV","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:35f79a0322b28080a9b91bd4678a076972e47f5328e78cb12afcd1b82d8aa7a0","observation_id":"dac7d91b-fe0b-4f15-b4be-493fd14a03ee","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2312.11805 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:6ad587219279ce420eb8be989c84f77708bee73f82a756d19496566b73b5b534","observation_id":"7b85d7d3-ee20-421a-84cf-f9c4bade943e","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2302.13971 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:45a7165b38c1f3f5e25202d9552ef053d6f0846eabca6d21f5a04e3a45d05c37","observation_id":"1a80582f-508d-4f15-9231-5a4d7d6deb9c","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv:2307.09288 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:fb8fcc10f7c7ef6cf944f4bbf72997b367858b5af28afd2c22e93b8b37a9d34f","observation_id":"cbb240cc-5e93-47cc-9801-319ebd9e1b52","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:3df1f5f025ba4bbdfaab55d747b13643669b157d10c58386155853be7e9be6b7","observation_id":"7189ef69-2297-4e59-a673-1eb616517dc2","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Machine Intelligence Research (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:28f8f2184573cd28955880262a5223d779c55da3b30c5cc2918b766987c2ee47","observation_id":"73e56558-2548-4938-968d-0b83975b64fc","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICCV","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:9d5bd2078593cf2b555d9e9658cb7f2396799f484b5d157d853ba80e7e3c4e32","observation_id":"c4f5f634-8189-4261-afb8-f4f95487a011","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:e5468e8a0090a7aa8197cd3cdf384cbc0c2a64ac6cc92487fa63a058ff1351e3","observation_id":"b8a6e547-2ca3-4297-a687-b5c140103a6d","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.03327","last_updated":"2018-09-06T04:19:45Z","snapshot_observed_at":"2026-07-06T07:00:12.122241Z","submitted_at":"2018-09-06T04:19:45Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.03327","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:1809.03327 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/1809.03327","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:ad5bac8951dceb334811fd0adad19e1f196e4541fcd3e8ce1ea71445c225d35b","observation_id":"ba25135d-c025-4de1-b363-f149987afac8","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ECCV","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:2aae0d26aeae17660dea272adb8848e0079bb48ef0669e599e8807621b871879","observation_id":"b10c7c05-e02b-4bea-8777-3fdf15331f2c","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14168","last_updated":"2024-08-01T15:56:43Z","snapshot_observed_at":"2026-08-13T04:34:48.147918Z","submitted_at":"2024-01-25T13:27:03Z","title":"Vivim: a Video Vision Mamba for Medical Video Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14168","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2401.14168 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2401.14168","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:b3ab5d51e99ac13a4209775678036f952a0c7296856e006ece6b2b7520373ead","observation_id":"7ed5a5f4-7b5f-4753-8be1-b4a8a65b32ec","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:ebea3a34139244a44d539ff7c5473f32629b8bf461d609628f7ffd357f919e25","observation_id":"290f63e8-2ef4-48ad-aabc-29890a19ab04","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2501.04001 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:f2cdfe6636140984ffee67a5d6e5a7f9113ef661db80f40886044fae12e1dc6d","observation_id":"f05d300c-997b-450d-ab5b-ea4fbd2a9409","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICCV","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:e18d11f9d137f50b62aa64ef30f46789db8942b6b6279649b5e9e4b4b235e3f1","observation_id":"33889bac-850f-4aeb-bee4-9b6d824e4b2e","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2306.02858 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:2cb7633a24f08221efc1b42529080fba5b91122e5a484bc0f4eca580aa73fe0a","observation_id":"8989a9ea-f1ed-4eb1-8c16-26734c29cd64","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: AAAI","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:51b32d65cf4282b4d40653baded3a7ca79e5c5b206825bdcd926194a7c8ba75c","observation_id":"e369217a-d568-4ef6-a4b4-d63108ace0bb","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17448","last_updated":"2023-12-29T03:22:18Z","snapshot_observed_at":"2026-08-13T04:52:26.368861Z","submitted_at":"2023-12-29T03:22:18Z","title":"Tracking with Human-Intent Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17448","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2312.17448 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2312.17448","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:6ada3e0099010cf8091f2941d27cddb3e3e2645ed932b7f8b7f034b87d7acfa5","observation_id":"8314b72e-9a63-4657-acf5-cebd372b1211","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:ac8bcec72e43646217ea1c9621f317bcdb1c1d57efcf56c1c64d88f7a6ab00d7","observation_id":"796b549c-8f3b-487a-87dc-907d78ce2ac4","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":86,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 0 inbound Pith citation observations for arXiv:2607.02922."}