{"as_of":"2026-08-21T03:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd3db699943460acedb26d0098144987fa203c015f05cc8e32827f1170c295f2","coverage":[{"denominator":110,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:01:18.047778Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T00:56:18.867382Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:27:15.698319Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"cited_work":{"arxiv_id":"2508.21809","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21809","snapshot_observed_at":"2026-07-02T17:27:15.698319Z","title":"VoCap: Video object captioning and segmen- tation from any prompt,","venue":null,"work_id":"4b6c80ee-df77-4a80-a23c-217b03b863ab","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2508.21809","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:e00f8520d2b435947c7ed2a012377536cc064c830bc0678e7c5edd86b9a0ce6f","observation_id":"501080c7-8714-494f-9325-48e7a4702264","resolution":{"observed_at":"2026-07-02T17:27:15.699718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.21809","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2508.21809 (2025) 11","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2508.21809","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:98f3ca708ddf27e296f8a84c5b1c8acfca9ff2fa441d25f9889e427478cbe5f6","observation_id":"c1f47cb2-a1bc-4129-a261-406d0b614598","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.21809/citation-record","integrity":"/paper/2508.21809/integrity","json":"/paper/2508.21809/citation-record.json","paper":"/paper/2508.21809"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:15.691477Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:15.691477Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:92f165ab2d95feead7e16eff62a08b4e5c30f4d4edc4e1e61747797aaf5bf7df","observation_id":"9177577e-76bf-47c2-b879-04cb54ee956f","resolution":{"observed_at":"2026-08-05T14:01:15.691477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:15.746526Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:15.746526Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:454d632ebd3a3151c8a4e747a52c255e9c3c7d9777f85d7adde169432ea5ca41","observation_id":"4b28fbf4-cae5-49e4-b130-0ecb18ca97cd","resolution":{"observed_at":"2026-08-05T14:01:15.746526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:15.824077Z","title":"Context r-cnn: Long term temporal context for per-camera object detection","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:15.824077Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:a36184e98241cc535caf7ed9e04e742bba443557e4bbb5d85425751bc7b71eef","observation_id":"0e08dbdd-2edc-4f41-bce3-00a182780fd5","resolution":{"observed_at":"2026-08-05T14:01:15.824077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:15.880769Z","title":"JAX: composable transformations of Python+NumPy programs, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:15.880769Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:4c87a98e5bf36ae263e43cd4208bc625a3bf73dc75523f19051333416a568dc4","observation_id":"2874a56a-9b25-4054-b70e-13bcec7da245","resolution":{"observed_at":"2026-08-05T14:01:15.880769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00737","last_updated":"2019-05-02T13:40:43Z","snapshot_observed_at":"2026-08-19T07:34:13.235173Z","submitted_at":"2019-05-02T13:40:43Z","title":"The 2019 DAVIS Challenge on VOS: Unsupervised Multi-Object Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00737","snapshot_observed_at":"2026-08-05T14:01:15.973996Z","title":"The 2019 davis challenge on vos: Unsupervised multi-object segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:15.973996Z"},"links":{"cited_paper":"/paper/1905.00737","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:d679158351a49a668e5f35855173ffb865370fe6296ef5f512b5050bed4788de","observation_id":"1f439b7b-b054-4b52-8a43-5bb14697f2f5","resolution":{"observed_at":"2026-08-05T14:01:15.973996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:16.063128Z","title":"nuscenes: A multimodal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:16.063128Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:c65239e5cbc099c0b783b360d4c66f26b4e7dd8c00f454de6d7abd42ab7ddede","observation_id":"1d125a6c-7184-413c-8e2a-93cdfe3cb89e","resolution":{"observed_at":"2026-08-05T14:01:16.063128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:16.133523Z","title":"Stablevideo: Text-driven consistency-aware diffusion video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:16.133523Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:cefe855404e177481592066ef956d8114dda244799b18052433f49b7f7f89116","observation_id":"df8eea38-b958-46b0-88d4-aedcbe49966f","resolution":{"observed_at":"2026-08-05T14:01:16.133523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-19T06:18:29.748887Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-05T14:01:16.184646Z","title":"Pali: A jointly-scaled multilingual language- image model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:16.184646Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:a9aae018b7192e8bf6de2e0e5219d20c2930c8e14cade723dbb53dddcabd3646","observation_id":"7b95b0c0-f4fe-4c59-9daf-220cedfc8e0e","resolution":{"observed_at":"2026-08-05T14:01:16.184646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:16.263063Z","title":"Per-pixel classification is not all you need for semantic segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:16.263063Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:2f99cc7b9deabd41498862557c3631378a7721b63232113301832ad4a59e5151","observation_id":"b58a7584-aef2-4cc0-8aa1-b51c705e54b3","resolution":{"observed_at":"2026-08-05T14:01:16.263063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:16.348008Z","title":"Xmem: Long-term video object segmentation with an atkinson-shiffrin memory model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:16.348008Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:af0acb66aebc84092416a1b9e036472bbc2e64b8dbab6de1c831e69dc1faac6c","observation_id":"c1e9961d-3d4b-4c70-bf9a-e5c47ce592f4","resolution":{"observed_at":"2026-08-05T14:01:16.348008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:16.434138Z","title":"Putting the object back into video object segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:16.434138Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:1a8e0d4232367c258a9e1b8088225a32305a3c52c9742595b54d67fbb81749e9","observation_id":"fd00fb5a-7009-4953-9119-15a1db801fea","resolution":{"observed_at":"2026-08-05T14:01:16.434138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-16T15:33:58.868647Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-05T14:01:16.517409Z","title":"Segment and track anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:16.517409Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:34d8b58f41e2fe9e0de224bb3442fbb16a31813260ceca2cc0ae8fbcaa7c017a","observation_id":"d3d34e96-2a6a-4207-a531-14fd3f85fee9","resolution":{"observed_at":"2026-08-05T14:01:16.517409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:16.597953Z","title":"Find first, track next: Decoupling identification and propagation in referring video object segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:16.597953Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:9eee4bfbfbe5b0208b0a5018c0bee27a55c38ce5b7a0d033bc1265f42459ba20","observation_id":"59ef5bd6-536b-4f9c-a433-c3cbf1968cd2","resolution":{"observed_at":"2026-08-05T14:01:16.597953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:16.689430Z","title":"Ow-viscaptor: Abstractors for open-world video instance segmentation and captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:16.689430Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:da041fee0f237c103a1d9ca45360f776008a3fdb6225376b985e7234d97dfaeb","observation_id":"b6eb5932-be1c-44b8-927a-9f6c338c64f2","resolution":{"observed_at":"2026-08-05T14:01:16.689430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:16.748592Z","title":"Scenic: A jax library for computer vision research and beyond","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:16.748592Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:bdf9ea6bb1c19fbdb980a94ef10f05871c594fe86d9c8878624542d86857a1a7","observation_id":"721f38f1-5d3f-41d8-88f2-94a18394aa17","resolution":{"observed_at":"2026-08-05T14:01:16.748592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:16.827030Z","title":"Memsam: Taming segment anything model for echocardiography video segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:16.827030Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:01dc7aa8f842663908f5b26d61969ca00bbe395b9f4b586dd39632afb8dfa715","observation_id":"16a7ea64-fec1-4e92-9025-369d3f0ecf66","resolution":{"observed_at":"2026-08-05T14:01:16.827030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:16.886981Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:16.886981Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:7a3555eeeaac0aa8bd27ccdc1645d0b6da171e2ac53068537b0b2ca07d3ac493","observation_id":"508e5e38-71f8-4802-a7f4-7bda04a4eca4","resolution":{"observed_at":"2026-08-05T14:01:16.886981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:16.961237Z","title":"Mevis: A large-scale benchmark for video segmentation with motion expressions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:16.961237Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:872527e9d3d3ff0c4215be064654efc840f875ac2d4e1c32a75f92330911da41","observation_id":"45a4fb90-4416-4353-bf32-56a713abf84c","resolution":{"observed_at":"2026-08-05T14:01:16.961237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.022115Z","title":"MOSE: A new dataset for video object segmentation in complex scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.022115Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:81d837b754ff39be18f144692df5ffbb3935ea53e7eaddf8251097134fadcc87","observation_id":"00dd6e78-bbe7-4fe8-9136-235ab55110a5","resolution":{"observed_at":"2026-08-05T14:01:17.022115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.098094Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.098094Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:389929136944e09bf4e6e6cb6908ecc80666a373763832f556907907513c55c9","observation_id":"f67cbf05-cbd4-482f-920d-67c153d78ab6","resolution":{"observed_at":"2026-08-05T14:01:17.098094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11331","last_updated":"2023-03-22T14:10:37Z","snapshot_observed_at":"2026-08-16T15:46:46.482584Z","submitted_at":"2023-03-20T17:59:59Z","title":"EVA-02: A Visual Representation for Neon Genesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11331","snapshot_observed_at":"2026-08-05T14:01:17.183470Z","title":"Eva-02: A visual representation for neon genesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.183470Z"},"links":{"cited_paper":"/paper/2303.11331","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:858ae847c0ab37bdfc1fae1582e76cc6bb5d819babf5128155f8492a655861ab","observation_id":"6747a0f9-37f7-4fcf-9395-2915513161f3","resolution":{"observed_at":"2026-08-05T14:01:17.183470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T14:01:17.239917Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.239917Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:3259aa0a90369652cf3351d0855ff4f8076a41330f9c94474053964d8b9dd5b7","observation_id":"5b629c41-94ce-44c9-8d93-a6c4abe62451","resolution":{"observed_at":"2026-08-05T14:01:17.239917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08781","last_updated":"2024-10-11T12:56:32Z","snapshot_observed_at":"2026-08-17T05:46:46.091006Z","submitted_at":"2024-10-11T12:56:32Z","title":"VideoSAM: Open-World Video Segmentation","version":1},"cited_work":{"arxiv_id":"2410.08781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.08781","snapshot_observed_at":"2026-08-05T14:01:18.695505Z","title":"VideoSAM: Open-World Video Segmentation","venue":"cs.CV","work_id":"39072e6a-628a-43a5-9c41-739f03f3d981","year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.298703Z"},"links":{"cited_paper":"/paper/2410.08781","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:136e57804fd8f50b35e937e874563a8f3f4af94b3842d0c1a56d60df28af7e0f","observation_id":"0b8176bb-ec41-460f-a59b-d8711ef0de9e","resolution":{"observed_at":"2026-08-05T14:01:18.703058Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.366945Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.366945Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:a128d812632eb9c968b23f0306c51d1e134068e39515d492fb0f9a4fd3379fc9","observation_id":"6d7c230e-35c5-4568-906a-76a94457ba27","resolution":{"observed_at":"2026-08-05T14:01:17.366945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.448996Z","title":"Decoupling static and hierarchical motion perception for referring video segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.448996Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:9bab0a261413e2dce31c86ff427ff0f9081e5d6e9b2659ed0f224ae46de81e46","observation_id":"6702ecee-8c0c-42ba-a0f7-6d2634eee613","resolution":{"observed_at":"2026-08-05T14:01:17.448996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.502682Z","title":"Instruct-imagen: Image generation with multi-modal instruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.502682Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:8bbd62c81965596cdffc15cf9d5b23463c9dd3b82c40236128320512f0a3a4c4","observation_id":"1c6717fd-d5db-4a7e-a5e3-b13941ee6882","resolution":{"observed_at":"2026-08-05T14:01:17.502682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.553355Z","title":"Segment and caption anything","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.553355Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:9b7b98322628cf4a271fc19d9f3ad0128ed21b8cea315ade3e1f2d150fa16414","observation_id":"259459b1-63b5-4526-a464-f708dd6b1677","resolution":{"observed_at":"2026-08-05T14:01:17.553355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.587039Z","title":"A better use of audio-visual cues: Dense video captioning with bi-modal transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.587039Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:32fb6dd9d930239dd95baef4cd161604f9d889b9dc7fbec43a92dce51c568b8d","observation_id":"33d9da2d-f6c1-4ba2-b1bf-fd554fb63942","resolution":{"observed_at":"2026-08-05T14:01:17.587039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.595806Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.595806Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:3115d9b2da175cfd3eb5b46df6164f9fe2fe7ae1ed673ebd6443660850803873","observation_id":"81b991e6-60d9-40a5-ba43-cdb91bcaa6b7","resolution":{"observed_at":"2026-08-05T14:01:17.595806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.602222Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.602222Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:f391cfc5e6883034c50f5a3e4afd30249ebda895e5e63b207ecf7cc383151c2f","observation_id":"075a4d78-04a8-40e2-b57e-23de063ff4f5","resolution":{"observed_at":"2026-08-05T14:01:17.602222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.610712Z","title":"Densecap: Fully convolutional localization networks for dense captioning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.610712Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:b10accb1008af417150338027aae05bf37a34b593c0ef9d815897b3a2f8e6d1d","observation_id":"6c3529bb-aa1e-468e-8f57-7a1d95d60664","resolution":{"observed_at":"2026-08-05T14:01:17.610712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.621165Z","title":"Kanani, Sriparna Saha, and Pushpak Bhattacharyya","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.621165Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:de50e310e17d7bece4706e71bae0573c2b0b80259a09cabab4eba60528571f35","observation_id":"c77ef26a-3202-4983-88b7-8ebf93db0f22","resolution":{"observed_at":"2026-08-05T14:01:17.621165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.627534Z","title":"Video object segmentation with language referring expressions","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.627534Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:8bad308ce0b192d0a0e9adf393b9adbf5e7f40d4d6bdfa5cd3b5f008dbd10bbb","observation_id":"2069cbfc-56f4-47ec-9832-55555d20f88a","resolution":{"observed_at":"2026-08-05T14:01:17.627534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.633229Z","title":"Video panoptic segmentation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.633229Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:40f53da257c35af17d97d73457a453d0ff8c5ad06e183c8e84bc713b540774f9","observation_id":"a6c63d63-bd18-4096-8acf-48f1bf76e627","resolution":{"observed_at":"2026-08-05T14:01:17.633229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.639259Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.639259Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:990313e307a8c19d586513fac9c23c145c1bd79e755c18d922ec87dfa01b16cc","observation_id":"c0e447a3-09f0-47d3-88bc-0a9aaaa470be","resolution":{"observed_at":"2026-08-05T14:01:17.639259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.644666Z","title":"Dense-captioning events in videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.644666Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:d2415c016991fc9aefc48bc075c4e4b9ff5798f1d45cbf23f82c44f65b501cf6","observation_id":"f4ff2a8b-c79d-417b-8f09-65ed0a8c227c","resolution":{"observed_at":"2026-08-05T14:01:17.644666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.533995Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":"c81a7ae3-165e-47a9-a439-783f2b56d9f9","year":2017},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.650657Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:9bb6abb5ec84cc9e37f8feea85132e9d61e0ec01ee5d07fb56fd0aee32e4473b","observation_id":"eac9522b-363c-4045-8bff-59058700cd60","resolution":{"observed_at":"2026-08-05T14:01:20.541463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00536","last_updated":"2023-09-17T09:01:52Z","snapshot_observed_at":"2026-08-16T15:19:23.847211Z","submitted_at":"2023-07-02T10:29:35Z","title":"Bidirectional Correlation-Driven Inter-Frame Interaction Transformer for Referring Video Object Segmentation","version":2},"cited_work":{"arxiv_id":"2307.00536","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.00536","snapshot_observed_at":"2026-08-05T14:01:18.648414Z","title":"Bidirectional Correlation-Driven Inter-Frame Interaction Transformer for Referring Video Object Segmentation","venue":"cs.CV","work_id":"bf9ae482-8eef-464c-8b39-0b6ac25fea30","year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.656301Z"},"links":{"cited_paper":"/paper/2307.00536","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:72b9aaa7e04d27fefd54c0379b4b38bd8f2fc6d9a2f20c23fee37920ab2daa00","observation_id":"02709fa6-6806-4d60-91e0-406cdbac60d9","resolution":{"observed_at":"2026-08-05T14:01:18.655013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.512435Z","title":"Pseudo-label: The simple and efficient semi-supervised learning method for deep neural networks","venue":null,"work_id":"c498943b-77cb-4732-a678-6b7faded2987","year":2013},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.662923Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:be75a1e727b9b75c0a7ce26c13458afbf0f89d930b9fb9ef088acfa1f32450db","observation_id":"e5c2ef69-ed6d-4bd2-a648-46efa7d3c36b","resolution":{"observed_at":"2026-08-05T14:01:20.521097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.482102Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large language models","venue":null,"work_id":"2c5168cf-a7d8-431c-9aad-5c7f91ef5bdd","year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.667573Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:dd7eec50494332e55fced0537aec3e89b9fb966a315efa5a9b67c17d6e7aff51","observation_id":"88920aa7-0cda-42af-9c7d-dc9954f24fbd","resolution":{"observed_at":"2026-08-05T14:01:20.489542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.453070Z","title":"Learning object context for dense captioning","venue":null,"work_id":"d1415884-1bb8-461f-9094-760732839c60","year":2019},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.673872Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:ba4d5d7c355d95b5dd18bdca5005c819e5ff2179f2da504ef87d71acc758d33e","observation_id":"0aad7dbe-5ff1-4662-80ab-fe44c90c0184","resolution":{"observed_at":"2026-08-05T14:01:20.461200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.428816Z","title":"Exploring plain vision transformer backbones for object detection","venue":null,"work_id":"fdef952f-43c7-4014-b551-beab606432a7","year":2022},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.678736Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:a42fab30e11c4040a05eae4eccf8fbdfd70c994b06cc41af39cd86c136dc5908","observation_id":"d712224b-a72a-4e4a-8f3e-a0bfed0eaa41","resolution":{"observed_at":"2026-08-05T14:01:20.438111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.385920Z","title":"Beyond mot: Semantic multi-object tracking","venue":null,"work_id":"a79a8c64-29a5-40d8-9d2a-0de0253ca05a","year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.684439Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:e73d66ac1487a187f42021807d73d99c683420083468970a08d9f03598cc47b0","observation_id":"0a7bcacd-eeb5-4fb0-93e9-c08967baec2c","resolution":{"observed_at":"2026-08-05T14:01:20.401508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-08-17T12:09:40.331965Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-05T14:01:17.690922Z","title":"Draw-and-understand: Leveraging visual prompts to enable mllms to comprehend what you want","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.690922Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:f8560947ae5e847764b2933db0c589690301c200b528766472c5ebc046460b82","observation_id":"b819030b-abb2-474b-a43c-1fdb5303f7b7","resolution":{"observed_at":"2026-08-05T14:01:17.690922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.696125Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.696125Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:c949e6678c6ee9389470833498e463dc82dca5fce94d33a70374e40acadc0d3c","observation_id":"c5e05588-bf31-435b-ac20-27d2e85eb79f","resolution":{"observed_at":"2026-08-05T14:01:17.696125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.328854Z","title":"Image segmentation using text and image prompts","venue":null,"work_id":"945182be-8acb-491a-a3bd-a3d566471622","year":2022},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.702937Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:c2f8399deaa008b57c62fd450962b18634c6570c099cddb8ab5c47b8422c9e92","observation_id":"209ca39c-956b-4d91-a462-2f5cd2b9b926","resolution":{"observed_at":"2026-08-05T14:01:20.337607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.303035Z","title":"Soc: Semantic-assisted object cluster for referring video object segmentation","venue":null,"work_id":"0c072c21-6a8c-403b-9009-c952f5a2e772","year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.708656Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:c891536df1959e1c6f7881fd5b953451dac7271315fba56b560d3d0d87727d95","observation_id":"ac956e77-cd96-456a-bf9d-d075ed517381","resolution":{"observed_at":"2026-08-05T14:01:20.311031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.278711Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"05c53565-f26a-42b6-98d0-f208ca4d1482","year":2016},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.714036Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:e5796cd095c5a9dcb78a6cbbbd0d616492bc3620196b1338092a84ef14506921","observation_id":"1b214c00-92d9-4c56-820f-076d44c8e8f8","resolution":{"observed_at":"2026-08-05T14:01:20.285378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.246913Z","title":"Scaling open-vocabulary object detection","venue":null,"work_id":"60f9bffb-be4f-4d7a-84f2-4b2244e24a13","year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.719388Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:232bd2ae95da56b28bce1fba1dbe57c71e2d1cb287c222c9f33557c61ccd396d","observation_id":"97fb6b6c-8501-423f-9c11-619ec0520100","resolution":{"observed_at":"2026-08-05T14:01:20.257724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.215082Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms","venue":null,"work_id":"b4e0eebc-3650-4ebd-a72b-e663bb1a5ad7","year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.726585Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:bf0835a5c720dd19c27dbf0b65f429a5662cf3f7780a0585153712a3c7909c72","observation_id":"c0e9d8b2-f9da-4f7d-a238-3d5f21ac534c","resolution":{"observed_at":"2026-08-05T14:01:20.226009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.174241Z","title":"Gpt-4v(ision) technical work and authors","venue":null,"work_id":"c0019de1-3246-4a0f-bd2f-2507e1beb820","year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.732795Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:ac37025c2b34189858b50d58d6db40b513ad64c83d8f200c993bf58cafc3a781","observation_id":"e8613517-5df2-446e-b494-aa657ac9f9a4","resolution":{"observed_at":"2026-08-05T14:01:20.186781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T14:01:17.740311Z","title":"Kosmos- 2: Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.740311Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:b8a0703bbbe339c6e1ec03ae785242d2a64ef1309f08d6666f0c36ac7438e0e2","observation_id":"c99daecb-c971-4c8e-b2cf-4124212af177","resolution":{"observed_at":"2026-08-05T14:01:17.740311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.143267Z","title":"Perazzi, J","venue":null,"work_id":"2d178d71-9fa1-453e-9871-e9d80041911d","year":2016},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.750541Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:9e8558eabf79c8ef61268b7de17a901ec48a4f9db40b84588dd8b4d3fc23390a","observation_id":"2a349ecd-bd05-47ae-9458-a62320139450","resolution":{"observed_at":"2026-08-05T14:01:20.151456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.119161Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":"f6593dec-3e8d-441b-b4dd-c1f8369f46a0","year":2015},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.762144Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:32273bdc73c10ae2ba4828e43cb4b99b4bfe3678247752befeab21de14a70844","observation_id":"047b2d75-2e1b-4597-8ec3-1352b02d854f","resolution":{"observed_at":"2026-08-05T14:01:20.128513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.769767Z","title":"Connecting vision and language with localized narratives","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.769767Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:158db0caebc402c37ca175d7bdc5ea09081c3b683ad897018409b82d6d19392c","observation_id":"daf5929b-7733-4dd7-b7d2-2f9781d1fcf8","resolution":{"observed_at":"2026-08-05T14:01:17.769767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.076237Z","title":null,"venue":null,"work_id":"232b4ef7-6266-4c48-ab8e-5566fcdba931","year":2022},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.778521Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:a0fd6713edde1cd9265f9274bdb109a595b0a863a09ad27e81de4d0bb549dfe2","observation_id":"2f433843-de19-4feb-9c59-54571dcbd76e","resolution":{"observed_at":"2026-08-05T14:01:20.087763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:20.051632Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"d934068c-f83e-45ce-b8e5-b60fb9ba2212","year":2021},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.785371Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:b2fdbbde9f95dbfae1f801619f3eed8af4af8faea6791bc61e9d256a1bae08c3","observation_id":"00934094-f590-4efc-8065-b9b4418ece4c","resolution":{"observed_at":"2026-08-05T14:01:20.059637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.790907Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.790907Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:e74adc5cb87f0a8cef539d6a48c8fae79910db1785f59ec721ca23cbe02a05db","observation_id":"67b91da0-785f-4eaf-a0f7-61732255d9dd","resolution":{"observed_at":"2026-08-05T14:01:17.790907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T14:01:17.799150Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.799150Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:2b655e9ddf9ed668e74e389a2c096854ca147530fe79e6aeab80a70fd5e89573","observation_id":"015ba149-0ab4-47dd-a96f-453410770f6f","resolution":{"observed_at":"2026-08-05T14:01:17.799150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.998357Z","title":"Youtube- boundingboxes: A large high-precision human-annotated data set for object detection in video","venue":null,"work_id":"af197afa-cfaf-492e-b54e-623363bcd56a","year":2017},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.807605Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:711e4ec30489e7b9618453c81e9ea79e1ba1bd44b0e676dc374ce248438bf95d","observation_id":"298b0a5c-55b7-446e-9eec-1bfdfe473786","resolution":{"observed_at":"2026-08-05T14:01:20.007307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.812043Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.812043Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:6f774ffba7800b6cb4b5fefa576e5699347cce6f960acbed838bce4bd75f46de","observation_id":"d1f04666-ef6f-4fd3-b188-1f2075ce5503","resolution":{"observed_at":"2026-08-05T14:01:17.812043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.961294Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":"990f46d4-09b7-482f-abff-09eedb241aa3","year":2015},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.817510Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:c218652a6602411bdcd21aee8908c8cb2e59d3db5b709cc2efe212bef876b0b6","observation_id":"2c89d1ec-60f0-4ec5-8062-292d5eefe26a","resolution":{"observed_at":"2026-08-05T14:01:19.968197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.916347Z","title":"Hiera: A hierarchical vision transformer without the bells-and-whistles","venue":null,"work_id":"bb236ca0-cc20-4d7d-90f8-18476ada0426","year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.822085Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:b9cf4a7316233da3b4aa32016bd4aa16a57d25ef33c1cd8b6587c5559e3d4ef5","observation_id":"9c714a6c-cc32-4d0d-8fb1-c6e0d7e68ec9","resolution":{"observed_at":"2026-08-05T14:01:19.934662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.883474Z","title":"Tokenlearner: Adaptive space-time tokenization for videos","venue":null,"work_id":"427dfcba-c70e-486f-8711-c2f26f057b8a","year":2021},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.827140Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:d3d9c3d16b4a7288f8d446234d64af13df5f598b7f5c207ad850735c1ac8adaf","observation_id":"c36ae280-65e0-471a-a2e6-738d8c47fe3d","resolution":{"observed_at":"2026-08-05T14:01:19.890989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.854179Z","title":"Urvos: Unified referring video object segmentation network with a large-scale benchmark","venue":null,"work_id":"e83586d8-1931-4c5b-b665-12eeff600ce7","year":2020},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.833973Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:b0b9e764ce122b25f3fa4739e80473f8c909c81fdceb36205cd56e0468a3ff1e","observation_id":"de29efa0-952a-47d5-94d1-8310d0897d9c","resolution":{"observed_at":"2026-08-05T14:01:19.862210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.805108Z","title":"Annotating objects and relations in user-generated videos","venue":null,"work_id":"3e2ddeb8-0476-47d6-a496-df6ba45f9da2","year":2019},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.839406Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:4ccc8a30ea189f92e709d3abd643ef662cd6a7cb218108e48df58fc62f663d90","observation_id":"eb82c4d2-4bf1-49f2-9550-83c922099e37","resolution":{"observed_at":"2026-08-05T14:01:19.814186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.762446Z","title":"Region-object relation-aware dense captioning via transformer","venue":null,"work_id":"c089dc22-ab9b-4adb-b386-55ac4e08c16e","year":2022},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.845053Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:26be1ce66a133ab08b5260921cdd6f363649d9a4da715ea0742377a8dead93a5","observation_id":"317edd14-e39c-4dbb-984f-57f9c1f2ccab","resolution":{"observed_at":"2026-08-05T14:01:19.771189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.729530Z","title":"What does clip know about a red circle? visual prompt engineering for vlms","venue":null,"work_id":"c983db9e-355b-4b39-b085-a73cc5349dd0","year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.853275Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:c363c4dcc664f8f4a713876b279e298d05f27023af2760a26f0691efbbe46fb6","observation_id":"3b4551fa-fdd1-4b54-a5a1-245f1020df62","resolution":{"observed_at":"2026-08-05T14:01:19.740260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.697075Z","title":"Video foundation models for animal behavior analysis","venue":null,"work_id":"ada26f4c-d0d6-4a31-99ed-af5ba9d31925","year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.860408Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:cb7185807cc5f6532c3e9ecfcf0b3e2e4b23190401aab8ff8f8a096a54a0a8e1","observation_id":"41ad1629-a574-43b7-84d9-88bfbd4b6591","resolution":{"observed_at":"2026-08-05T14:01:19.702233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.865273Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.865273Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:d6e06faa289a86df9ce3aa93f585b96d1f679be8d78c25ae19d8b37c9580b1a4","observation_id":"8e79880d-d477-4a52-9edc-08113a32497b","resolution":{"observed_at":"2026-08-05T14:01:17.865273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-05T14:01:17.871477Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.871477Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:1d165a17824fed9a2cbc27c9018025c8f87090a5f6fe5a1b67b71949b8028955","observation_id":"66638174-134c-448a-8f47-8dd4c160250f","resolution":{"observed_at":"2026-08-05T14:01:17.871477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T14:01:17.880826Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.880826Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:b4e3a6e60f346c80a6461cfe03f95cfa7d4c3b9d15aa1fdb385f054cdb524bc5","observation_id":"494a617f-2afe-4654-8bf5-8521bb3e8b92","resolution":{"observed_at":"2026-08-05T14:01:17.880826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T14:01:17.886308Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.886308Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:bca62294d5f0c9fb1bb3f293a1879fa7ef24256ca2440fb7d2852bd2597640ce","observation_id":"3b3fd1a2-1124-4050-8d20-b132447d8328","resolution":{"observed_at":"2026-08-05T14:01:17.886308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:17.891687Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.891687Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:2edac2974a40207133104b512080825f0768b54e97a8d4c509a812c8233368ea","observation_id":"ee97b73b-be38-47f1-8c9a-70004761ad0f","resolution":{"observed_at":"2026-08-05T14:01:17.891687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.614478Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":"f96dc9b7-07dd-44c7-8f28-0e214b3781c4","year":2015},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.896550Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:46374f9e77fa8926e2cd2f3de4e038db6d98c264c2ae0f73681c7d8fdf18109a","observation_id":"6fd80b34-72bd-4cc3-9c36-b1359b36f6c2","resolution":{"observed_at":"2026-08-05T14:01:19.621641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.591637Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":"e8a6ed28-e54f-4585-b252-c554c3600dab","year":2022},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.905108Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:1416ce6817b9d3c624a28798f0826f0d7d7efa3fd2123e3196b2333b91f5c3f3","observation_id":"04161a33-0846-43ff-a739-6bf328814047","resolution":{"observed_at":"2026-08-05T14:01:19.598780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.567524Z","title":"Connecting vision and language with video localized narratives","venue":null,"work_id":"b9d49977-4a38-488f-b20e-b3edfd36de1d","year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.910810Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:99f881fb825f8caaba1ec938511bbd76c38843d405e23795d38153d95ffe6d45","observation_id":"93bb1291-efe9-4fea-a86c-4c3458880499","resolution":{"observed_at":"2026-08-05T14:01:19.574760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.548531Z","title":"Git: A generative image-to-text transformer for vision and language","venue":null,"work_id":"de7b0de1-9527-4990-a705-98347a1e586c","year":2022},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.915952Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:2cda5770aed4791deae5b206ae46bcdc0111ca15572ac410f5080b91c00373e3","observation_id":"76f7b4b0-3460-45d5-a143-cdc5a9dbe52a","resolution":{"observed_at":"2026-08-05T14:01:19.554837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.506066Z","title":"End-to-end dense video captioning with parallel decoding","venue":null,"work_id":"95abe46c-7e54-40ed-a823-56ea355d4c0b","year":2021},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.920936Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:8a63e5f363f1332f52a72cd2755ccf100217feaf9c50f4e405ccdd0a2b5cac34","observation_id":"ddd0f84e-71ef-41e2-b5b5-b85091610457","resolution":{"observed_at":"2026-08-05T14:01:19.518822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02677","last_updated":"2023-07-06T13:47:21Z","snapshot_observed_at":"2026-08-18T11:15:44.490559Z","submitted_at":"2023-05-04T09:48:22Z","title":"Caption Anything: Interactive Image Description with Diverse Multimodal Controls","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02677","snapshot_observed_at":"2026-08-05T14:01:17.925533Z","title":"Caption anything: Interactive image description with diverse multimodal controls","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.925533Z"},"links":{"cited_paper":"/paper/2305.02677","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:2fbe38353e7e9e7ff1425e639ff758a72dd7d08bbc294c2c85eccd90b5abd777","observation_id":"d78b6e5f-978c-4106-b90a-5f503598f5ac","resolution":{"observed_at":"2026-08-05T14:01:17.925533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.478871Z","title":"Unidentified video objects: A benchmark for dense, open-world segmentation","venue":null,"work_id":"22cc01f5-0f64-441c-abc8-88ce2e77b5ea","year":2021},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.930332Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:33b2327b5524fa49e9ba81d7a104377d59636690f04f0020d2df2fef0c403a8d","observation_id":"edfe104c-d0a3-4856-b530-fe9e64d72b31","resolution":{"observed_at":"2026-08-05T14:01:19.485562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.443703Z","title":"The all-seeing project: Towards panoptic visual recognition and understanding of the open world","venue":null,"work_id":"8e53f8a3-0cb3-423a-a658-c948a9495d7d","year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.935974Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:c1e85329d3d3847776f05c9a7bc9466e708e5c24bcf6c3147a5d4a3ea5f666f1","observation_id":"5dccc15b-8b05-4d5b-9b86-998459bd7ad9","resolution":{"observed_at":"2026-08-05T14:01:19.451196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19474","last_updated":"2024-08-23T07:20:57Z","snapshot_observed_at":"2026-08-20T17:59:02.811651Z","submitted_at":"2024-02-29T18:59:17Z","title":"The All-Seeing Project V2: Towards General Relation Comprehension of the Open World","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19474","snapshot_observed_at":"2026-08-05T14:01:17.942135Z","title":"The all-seeing project v2: Towards general relation compre- hension of the open world","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.942135Z"},"links":{"cited_paper":"/paper/2402.19474","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:cb1b1e401ddff78267083bb9b647cb116f4c1abde355efc4c747e13c36c24889","observation_id":"1daf37a9-7708-467f-9ccb-7631b853dd2b","resolution":{"observed_at":"2026-08-05T14:01:17.942135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.415029Z","title":"Instancediffusion: Instance-level control for image generation","venue":null,"work_id":"46e9a103-d40e-4397-883d-fc8c3b011866","year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.948334Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:bec3c1cb23119a004701b3b3faba1998dccf88390431291e96e669ef0de83415","observation_id":"a59b876c-4e5d-41bb-aa62-b96cdfca49c2","resolution":{"observed_at":"2026-08-05T14:01:19.426563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.389502Z","title":"Language as queries for referring video object segmentation","venue":null,"work_id":"937c17d2-beec-4a14-8feb-330d744a8c3a","year":2022},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.954568Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:3ad5d1d5dc0b137378ec677d950fdb37174823e6b6d32c086a28cd0bfe787e95","observation_id":"d24b68d0-16ec-4dfa-bc4b-bb4a07d1beb5","resolution":{"observed_at":"2026-08-05T14:01:19.397909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15715","last_updated":"2023-12-25T12:54:11Z","snapshot_observed_at":"2026-08-18T13:01:50.390931Z","submitted_at":"2023-12-25T12:54:11Z","title":"UniRef++: Segment Every Reference Object in Spatial and Temporal Spaces","version":1},"cited_work":{"arxiv_id":"2312.15715","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.15715","snapshot_observed_at":"2026-08-05T14:01:18.387281Z","title":"UniRef++: Segment Every Reference Object in Spatial and Temporal Spaces","venue":"cs.CV","work_id":"562e7507-10dd-4915-8dc4-33462acc8b16","year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.960362Z"},"links":{"cited_paper":"/paper/2312.15715","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:3ba4d682f1ed1c7d6f3fec651202fb0f2c0c377fa0207374a06966017408ddbc","observation_id":"2e6c14ce-75b9-49c9-96ef-bcefd03f0a57","resolution":{"observed_at":"2026-08-05T14:01:18.397693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.370127Z","title":"General object foundation model for images and videos at scale","venue":null,"work_id":"dd91ad13-1945-4585-a022-1a3d38d13f97","year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.966174Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:9215352f19636b4f5b710140c6c2c53c139ec76fdf48d2aa93c53d0845b17eb5","observation_id":"b41afe1f-22a7-4ab7-9a9e-29c1d14a7a23","resolution":{"observed_at":"2026-08-05T14:01:19.377670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.343510Z","title":"Grit: A generative region-to-text transformer for object understanding","venue":null,"work_id":"b3cd93f2-e2a3-4d3f-babc-86ae76dd35b2","year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.975222Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:17596de0e59dc72874fe3a8fa67945babd709cedc4b4c5a4ccd86e0c7bc32355","observation_id":"6ba209f7-85dc-46f5-be63-4b677a35aee7","resolution":{"observed_at":"2026-08-05T14:01:19.352240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.316479Z","title":"Dettoolchain: A new prompting paradigm to unleash detection ability of mllm","venue":null,"work_id":"36d0f854-a0e5-4ceb-96a8-6f5900810ff1","year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.980591Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:ced41a7868917a7634a0a1b4f82f5d9c95b1556a3b29345ffef737e164cdfc0c","observation_id":"bd63d38f-194e-4ba3-9319-3ee30bf19a55","resolution":{"observed_at":"2026-08-05T14:01:19.328388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.270071Z","title":"Pixel-aligned language model","venue":null,"work_id":"d1b26998-b871-4f85-83c0-228aab4c142b","year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.986304Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:b9eeafe9c93e7239ee532a0ffc1cc4f53b8f54ce7ad5570d90a65e04dcd3955d","observation_id":"a952e8fd-2d3c-4193-abab-4eb57748c530","resolution":{"observed_at":"2026-08-05T14:01:19.282154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.234951Z","title":"Youtube-vos: Sequence-to-sequence video object segmentation","venue":null,"work_id":"631abedb-7812-495d-bb36-1a42f8cf6820","year":2018},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:17.994291Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:eb515632e0708361e68f2cf7066f9c426ccdbd537d3333a4c14a4ffc268a8e9f","observation_id":"10886054-f88b-4cdd-8a12-d32a13b39de9","resolution":{"observed_at":"2026-08-05T14:01:19.243223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:18.000551Z","title":"xgen-mm (blip-3): A family of open large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:18.000551Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:795d63226fd2500111d3155b5c49253de9f5304920442ac57901dc893ab6eed8","observation_id":"0ea80731-72c7-4620-b19b-ed2f23f557f6","resolution":{"observed_at":"2026-08-05T14:01:18.000551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.213740Z","title":"Vid2seq: Large-scale pretraining of a visual language model for dense video captioning","venue":null,"work_id":"00aa194e-4bb9-4dd8-9e9f-2d5b0fe018b3","year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:18.005261Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:4cacfd6d8110d343894feabf2822ad1da1b54c1f279e39c43c8397546588a7e3","observation_id":"524bf4cc-24fa-4109-9c75-fe402ae84dab","resolution":{"observed_at":"2026-08-05T14:01:19.221648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11968","last_updated":"2023-04-28T03:21:27Z","snapshot_observed_at":"2026-08-17T08:48:49.593119Z","submitted_at":"2023-04-24T10:04:06Z","title":"Track Anything: Segment Anything Meets Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11968","snapshot_observed_at":"2026-08-05T14:01:18.011590Z","title":"Track anything: Segment anything meets videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:18.011590Z"},"links":{"cited_paper":"/paper/2304.11968","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:5ef06c57632f3fdf51673c8c8f2ec62741fc74eee8a4151177d62f9ca354d1aa","observation_id":"dc07d712-d243-49bb-9167-63d0ab8cde11","resolution":{"observed_at":"2026-08-05T14:01:18.011590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-05T14:01:18.017383Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:18.017383Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:c13ebcb1a2148068affb3a008ffd2e693013be03281757051509228fec01baae","observation_id":"0deecbdc-995a-4edd-b1b3-a9fed35a2141","resolution":{"observed_at":"2026-08-05T14:01:18.017383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.180194Z","title":"Decoupling features in hierarchical propagation for video object segmentation","venue":null,"work_id":"e1263a89-64bc-4fea-b5cd-a91c85e2d775","year":2022},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:18.022264Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:0951852ab63f561908cb9f90d60d7823e9320eb02ac080a7bf5f2c3f2bbf569f","observation_id":"1d442d00-cc26-4cd2-ab3a-5d1ef693dfdc","resolution":{"observed_at":"2026-08-05T14:01:19.187726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.148923Z","title":"Associating objects with transformers for video object segmentation","venue":null,"work_id":"c3c3005d-ed39-4fa6-99d1-143d2df39449","year":2021},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:18.030383Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:70b36d84fa36266f07f60af3cb2303f31878778b8182494ef0d218bbf3bce0a9","observation_id":"3d09fbf5-b2e4-47fe-925c-160612d99570","resolution":{"observed_at":"2026-08-05T14:01:19.158353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.128457Z","title":"Scalable video object segmentation with identification mechanism","venue":null,"work_id":"3a0590f4-44e2-4ddd-991c-a8532e92a5f2","year":2024},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:18.036508Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:b5a405d5083431a4da49bd5a9a114123d6a95ec96ff963be1e980f825563d7a8","observation_id":"a4f0f111-19a8-4746-a4f8-cd040d2366b8","resolution":{"observed_at":"2026-08-05T14:01:19.135352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.102980Z","title":"Describing videos by exploiting temporal structure","venue":null,"work_id":"981be5e0-47be-4a07-9cea-efb4b2213155","year":2015},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:18.042153Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:7528cd0abf79ccff3dddc8059dc9a18241f78c3f4339eabf9f5b219d5706a1c7","observation_id":"1c1d4855-d106-4023-abbd-8fadeba161e6","resolution":{"observed_at":"2026-08-05T14:01:19.112159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:01:19.078579Z","title":"Modeling context in referring expressions","venue":null,"work_id":"d5cbb517-8ab6-4016-8a57-7ff7cce3500a","year":2016},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:18.047778Z"},"links":{"citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:018839619ad31478b0b988873a7c0898b709beb15314c75c915de7d50be01011","observation_id":"37ff9346-5dfa-40b8-b6c7-454f4ad94255","resolution":{"observed_at":"2026-08-05T14:01:19.084617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T18:48:00.823889Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":3,"verified_fuzzy":44},"total_outbound_references":110},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 110 outbound references and 2 inbound Pith citation observations for arXiv:2508.21809."}