{"as_of":"2026-08-19T23:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c8583e10d5b97aaae718c56b1701e79786c0dd41e7e418e06140c7030c25234","coverage":[{"denominator":101,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:49:43.782509Z","state":"measured"},{"denominator":106,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":106,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:20:59.262348Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T09:43:49.389473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10332","snapshot_observed_at":"2026-08-07T15:20:59.262348Z","title":"Number it: Temporal grounding videos like flipping manga.arXiv preprint arXiv:2411.10332, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-14T13:01:23.064925Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:59.262348Z"},"links":{"cited_paper":"/paper/2411.10332","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:898642a91840392870a3d56d674bc02475c8f02d2fa8ff0dac99e94a93a88c40","observation_id":"4e3c51c5-4ff5-45b9-bf7d-a5636c50b639","resolution":{"observed_at":"2026-08-07T15:20:59.262348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10332","snapshot_observed_at":"2026-08-07T11:08:45.397760Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-18T00:57:13.199663Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:45.397760Z"},"links":{"cited_paper":"/paper/2411.10332","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:e4fe09a9709b06c2b02c478cdadd16125403c4fa01e06cf3a2eef2237fa2cd4e","observation_id":"e62bb179-dca9-4451-af74-35c82c258d88","resolution":{"observed_at":"2026-08-07T11:08:45.397760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10332","snapshot_observed_at":"2026-08-07T05:09:22.277066Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08691","last_updated":"2025-06-10T11:02:36Z","snapshot_observed_at":"2026-08-15T05:11:45.186303Z","submitted_at":"2025-06-10T11:02:36Z","title":"VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:22.277066Z"},"links":{"cited_paper":"/paper/2411.10332","citing_paper":"/paper/2506.08691"},"observation_digest":"sha256:12d3338e925bca7a889a2daa745b57db8049097e07e1f088d28edaa8f12b931f","observation_id":"7e1acb8e-75d2-4094-aa64-372b6ae565b4","resolution":{"observed_at":"2026-08-07T05:09:22.277066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10332","snapshot_observed_at":"2026-08-05T23:32:17.943418Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.943418Z"},"links":{"cited_paper":"/paper/2411.10332","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:7843dcdb65210518686d0f4dd93d72c50fd4f8b00e334dcad5496b82acc78bbb","observation_id":"c79c5776-cd85-4233-a118-800e5393bb60","resolution":{"observed_at":"2026-08-05T23:32:17.943418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"cited_work":{"arxiv_id":"2411.10332","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10332","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2411.10332 , year=","venue":null,"work_id":"b419e883-4f38-4dd9-95aa-a18d4c5d9334","year":null},"citing_paper":{"arxiv_id":"2604.18562","last_updated":"2026-04-22T02:31:50Z","snapshot_observed_at":"2026-08-15T17:10:49.071119Z","submitted_at":"2026-04-20T17:49:22Z","title":"AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-10T05:10:44.608959Z"},"links":{"cited_paper":"/paper/2411.10332","citing_paper":"/paper/2604.18562"},"observation_digest":"sha256:5d5c4065ab6ddf2144a4d8b8b743b909be9190d870a17e771a51ddea097b30e6","observation_id":"64179649-6c66-45a4-8c0a-944396226658","resolution":{"observed_at":"2026-05-10T09:43:49.391833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10332","snapshot_observed_at":"2026-07-31T23:32:54.533949Z","title":"Number it: Temporal grounding videos like flipping manga.arXiv preprint arXiv:2411.10332, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23951","last_updated":"2026-07-27T02:56:43Z","snapshot_observed_at":"2026-08-16T00:05:24.719723Z","submitted_at":"2026-07-27T02:56:43Z","title":"TimePLE: Rethinking Temporal Representation for Video Temporal Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T23:32:54.533949Z"},"links":{"cited_paper":"/paper/2411.10332","citing_paper":"/paper/2607.23951"},"observation_digest":"sha256:484cae1b5dc7cc43bbd4fc474da3e4dc7f75548f8592a48fd51a48e33571a776","observation_id":"236e8bce-f0ed-463a-895b-a3947d3cf26b","resolution":{"observed_at":"2026-07-31T23:32:54.533949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.10332/citation-record","integrity":"/paper/2411.10332/integrity","json":"/paper/2411.10332/citation-record.json","paper":"/paper/2411.10332"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T19:49:43.271932Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.271932Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:f3406bc9289d8b246001145b24fbae611c1cb0a263cb77e67650614a32ebf12a","observation_id":"6e27ab6e-8d49-4f7e-a5b2-f40d22d73eb7","resolution":{"observed_at":"2026-08-12T19:49:43.271932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13653","last_updated":"2023-05-23T03:53:57Z","snapshot_observed_at":"2026-08-16T15:30:49.623497Z","submitted_at":"2023-05-23T03:53:57Z","title":"RaSa: Relation and Sensitivity Aware Representation Learning for Text-based Person Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13653","snapshot_observed_at":"2026-08-12T19:49:43.277756Z","title":"Rasa: Relation and sensitivity aware representation learning for text-based person search","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.277756Z"},"links":{"cited_paper":"/paper/2305.13653","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:4ea3f7d28ece873d2e4191dd2aa90776d69d7e1e81cabd1413e95a9449972e82","observation_id":"72e74eea-765b-4db3-9a77-090e307a35c5","resolution":{"observed_at":"2026-08-12T19:49:43.277756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.283074Z","title":"The surprising effectiveness of multimodal large language models for video moment retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.283074Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:7105e0256e45afe9256912c36a2a4db489c09565b77eeccfee7aa171974c8ce0","observation_id":"51485249-0540-4699-b758-f7d90e4a49e0","resolution":{"observed_at":"2026-08-12T19:49:43.283074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.288171Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.288171Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:26a07803b147807cdf279a321202f753cb0d7ee043759b26d56dee4252ca11dd","observation_id":"6d94de45-1e3f-4ae3-8853-9f4724b5450d","resolution":{"observed_at":"2026-08-12T19:49:43.288171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.293876Z","title":"Vip- llava: Making large multimodal models understand arbitrary visual prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.293876Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:b50248d08a7d95fc35f16311035bd56a7746b5cc4a60ff3d71e210c552641e8f","observation_id":"69faa14f-5026-4bd5-a722-8b1a8fb90c15","resolution":{"observed_at":"2026-08-12T19:49:43.293876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.298855Z","title":"Progressive bilateral-context driven model for post-processing person re-identification","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.298855Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:e73a4dc01e69a61803260e354596b0d4f68a9d9dd409d4474977a05a2ed8f166","observation_id":"7096712d-dc08-4519-973f-04955a4c4edb","resolution":{"observed_at":"2026-08-12T19:49:43.298855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14713","last_updated":"2022-11-18T10:12:11Z","snapshot_observed_at":"2026-08-16T17:11:18.997411Z","submitted_at":"2022-03-28T13:00:01Z","title":"Image-text Retrieval: A Survey on Recent Research and Development","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14713","snapshot_observed_at":"2026-08-12T19:49:43.304365Z","title":"Image-text retrieval: A survey on recent research and development","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.304365Z"},"links":{"cited_paper":"/paper/2203.14713","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:65dd2465b83d9f50980065e994c9647cd1796de2e4684e997a40cf119ff3024e","observation_id":"4654a0f1-076a-47c9-94ac-674fa74120fc","resolution":{"observed_at":"2026-08-12T19:49:43.304365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.309359Z","title":"An empirical study of clip for text-based person search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.309359Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:b66f650e0307caa55974a83735871c7ad664ea2ca7ce843bd539c982b40c4598","observation_id":"2c1476d4-0379-45ec-ab13-99bb0fa5505a","resolution":{"observed_at":"2026-08-12T19:49:43.309359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.314089Z","title":"An empirical study of clip for text-based person search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.314089Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:149b722c33783ba0e54c467a8ed7a797c8933092cc8f5d2ec4bcaf5b54d5e02a","observation_id":"7b1695a7-7ab0-4b01-96ba-62029f41cea9","resolution":{"observed_at":"2026-08-12T19:49:43.314089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.319675Z","title":"End- to-end multi-modal video temporal grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.319675Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:08ba9fe62ec274266fe92a41144f7d5f140ea96439d765c2cacc157b72b9b68c","observation_id":"7aefe83a-b8f4-464e-bd6c-c8a679f34b62","resolution":{"observed_at":"2026-08-12T19:49:43.319675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05136","last_updated":"2024-03-11T07:32:31Z","snapshot_observed_at":"2026-08-18T22:31:39.228807Z","submitted_at":"2023-10-08T12:10:44Z","title":"InstructDET: Diversifying Referring Object Detection with Generalized Instructions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05136","snapshot_observed_at":"2026-08-12T19:49:43.324512Z","title":"Instructdet: Diversifying referring ob- ject detection with generalized instructions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.324512Z"},"links":{"cited_paper":"/paper/2310.05136","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:9db4c59f7c82bd2b074d1b173a81110e59ba44cfae20585338f5152acf995a30","observation_id":"de3edf37-4da3-4ce3-b00c-c91aa7b91e7b","resolution":{"observed_at":"2026-08-12T19:49:43.324512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T19:49:43.329699Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.329699Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:3b6d25d8a9aee8ac0ad8c5846ae5c2c69ed50cc1e0f052d18baca94e3f67aa79","observation_id":"30a36257-8ce9-444f-929c-9cc9ffd8e0e0","resolution":{"observed_at":"2026-08-12T19:49:43.329699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11691","last_updated":"2025-08-28T09:40:49Z","snapshot_observed_at":"2026-08-19T20:41:01.940407Z","submitted_at":"2024-07-16T13:06:15Z","title":"VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11691","snapshot_observed_at":"2026-08-12T19:49:43.334478Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.334478Z"},"links":{"cited_paper":"/paper/2407.11691","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:f251a12a7666e6c0e5d49b3a4db4029fcf8153003ebb203e8001d4955249e8f2","observation_id":"9b2b6afd-e249-426a-9884-5d899c6e2245","resolution":{"observed_at":"2026-08-12T19:49:43.334478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.339509Z","title":"Cityllava: Efficient fine-tuning for vlms in city scenario","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.339509Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:759e4846ff303c8e3546ed4752cbba86cd60e1e578cec663418b672bec7a008e","observation_id":"55ff0f91-8ea2-412b-9bc5-b194286f9130","resolution":{"observed_at":"2026-08-12T19:49:43.339509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.343963Z","title":"System- status-aware adaptive network for online streaming video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.343963Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:ca44be8de6233eb24dc0c59512dbd3dbfed8397b278307930ddcd92810db8e68","observation_id":"2b825821-aa6b-4a71-bc83-42cdc2fafece","resolution":{"observed_at":"2026-08-12T19:49:43.343963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-12T19:49:43.348499Z","title":"Video-mme: The first-ever compre- hensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.348499Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:91849cc531cbd46a919b716852cfd7bc3b604c5c0fb26581184a3a8282c95768","observation_id":"19655bc8-82cc-496c-8605-de77949e833b","resolution":{"observed_at":"2026-08-12T19:49:43.348499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.353673Z","title":"Fast video moment re- trieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.353673Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:c79e741e51f48a54a0e6c7221b2b25ff9aaa7f44f26f966bea6fc6191fb66921","observation_id":"5c093acf-5c4d-4376-9079-b5a4e9ff882b","resolution":{"observed_at":"2026-08-12T19:49:43.353673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.358620Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.358620Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:2acf6d5d73bd3d3d0d072202c7f3b322213f97ce5d22b24d5bc4db7c5b409959","observation_id":"23988d94-7d0b-46c1-8ed7-326ba4e2628d","resolution":{"observed_at":"2026-08-12T19:49:43.358620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00714","last_updated":"2024-12-01T07:27:20Z","snapshot_observed_at":"2026-08-19T12:40:18.769960Z","submitted_at":"2024-12-01T07:27:20Z","title":"Scaling New Frontiers: Insights into Large Recommendation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00714","snapshot_observed_at":"2026-08-12T19:49:43.364700Z","title":"Scaling new frontiers: In- sights into large recommendation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.364700Z"},"links":{"cited_paper":"/paper/2412.00714","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:12754aebc27929ed5c497a0e15158040d0e529a64fd810585f31d8d8f94db336","observation_id":"bd6fdd50-76ce-4130-83e9-4fb054b96c1a","resolution":{"observed_at":"2026-08-12T19:49:43.364700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13382","last_updated":"2025-02-01T03:55:30Z","snapshot_observed_at":"2026-08-19T07:24:41.152560Z","submitted_at":"2024-05-22T06:31:42Z","title":"VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13382","snapshot_observed_at":"2026-08-12T19:49:43.369881Z","title":"Vtg-llm: Integrating timestamp knowl- edge into video llms for enhanced video temporal grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.369881Z"},"links":{"cited_paper":"/paper/2405.13382","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:2033e4b6f306b4aba4738b1ef36fd616f233a6dbf0b7ab30b6f9e01f945df2b1","observation_id":"94d173e7-b44a-440d-987d-b0353c541ff7","resolution":{"observed_at":"2026-08-12T19:49:43.369881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05643","last_updated":"2025-03-03T10:28:30Z","snapshot_observed_at":"2026-08-16T13:11:41.243735Z","submitted_at":"2024-10-08T02:46:30Z","title":"TRACE: Temporal Grounding Video LLM via Causal Event Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05643","snapshot_observed_at":"2026-08-12T19:49:43.374768Z","title":"Trace: Temporal grounding video llm via causal event modeling.arXiv preprint arXiv:2410.05643,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.374768Z"},"links":{"cited_paper":"/paper/2410.05643","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:2e8d2f734fe7f24cb118150f35c3226e011090d5a8f60a977d9ddde7ebd2c409","observation_id":"63b88a5e-6050-47ba-a9c7-d690d850d67e","resolution":{"observed_at":"2026-08-12T19:49:43.374768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.380500Z","title":"Homeomorphism prior for false posi- tive and negative problem in medical image dense contrastive representation learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.380500Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:6a9af4d3c6004f41694cdc26a0ff3581253973b39fcf5049dfd9f920e68d49a9","observation_id":"28b9663f-688b-420b-8df6-2c973fdb6a44","resolution":{"observed_at":"2026-08-12T19:49:43.380500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-18T00:01:15.410179Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-12T19:49:43.385753Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.385753Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:249c77f266f8376f6df4ee3a5e8c1c152a00826b44bce14263a51c3038244894","observation_id":"e54aaa00-c38d-4514-a277-f47c263a2bd6","resolution":{"observed_at":"2026-08-12T19:49:43.385753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.390812Z","title":"Lora: Low- rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.390812Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:1ab959af4648870b4280d6fd8d873e77aa342a82407ae24a2d55737620a4d55f","observation_id":"7033bc6f-0678-4306-9ec1-1ea8e26ab70c","resolution":{"observed_at":"2026-08-12T19:49:43.390812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.395369Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.395369Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:635bb60615cff64cc7d3c8e81b8f0fb1236096823bee12c333979491ff6f89eb","observation_id":"7e740943-f226-4117-ae00-bc2d36886610","resolution":{"observed_at":"2026-08-12T19:49:43.395369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19046","last_updated":"2024-03-27T22:50:48Z","snapshot_observed_at":"2026-08-16T14:05:42.177706Z","submitted_at":"2024-03-27T22:50:48Z","title":"LITA: Language Instructed Temporal-Localization Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19046","snapshot_observed_at":"2026-08-12T19:49:43.401035Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.401035Z"},"links":{"cited_paper":"/paper/2403.19046","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:2c304d6976a72ad8f4730367f9c6eacaafb070c17a68763c695097fcb7fb9c1c","observation_id":"5e2bf25e-8a6b-4cb6-aa13-0a76dce4666a","resolution":{"observed_at":"2026-08-12T19:49:43.401035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.405965Z","title":"Dg- pic: Domain generalized point-in-context learning for point cloud understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.405965Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:5ad5e2c2928a42fc08c31434fbbfeb00d16958e08927d18638518c217d44bfc0","observation_id":"506ce60d-03f8-44f0-bde1-05b22e3252e7","resolution":{"observed_at":"2026-08-12T19:49:43.405965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.410751Z","title":"Do you remember? dense video captioning with cross-modal memory retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.410751Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:d808d7fa41dfde129acd368968c877e8068989cbf8001f2818e1ec04d0774a45","observation_id":"1a7d9609-adf3-48a2-8e71-24552839217c","resolution":{"observed_at":"2026-08-12T19:49:43.410751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-12T19:49:43.415479Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.415479Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:cce10aa6298095287d353bcc300c52a3805b111dacc32734c77ed05c881b3d32","observation_id":"624db7aa-a8ab-42bd-9fdc-c622c3847fe8","resolution":{"observed_at":"2026-08-12T19:49:43.415479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.420390Z","title":"Multi-scale spatial-temporal attention networks for functional connectome classification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.420390Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:d3aa01ce32d9d993eb515c3319390b3cc3dca694c176ae3de91022e4ce888db9","observation_id":"91cf0829-593d-4968-b7d4-0358d816f9f2","resolution":{"observed_at":"2026-08-12T19:49:43.420390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.424914Z","title":"Dense-captioning events in videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.424914Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:0eef4f0f74837897979180bb7fb3675686070fb98f6fc9d7540994f0127d613e","observation_id":"8f4931d5-9099-49bb-ad9c-1c7491b00e05","resolution":{"observed_at":"2026-08-12T19:49:43.424914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11248","last_updated":"2024-06-02T17:34:18Z","snapshot_observed_at":"2026-08-16T14:17:46.321287Z","submitted_at":"2024-02-17T11:03:02Z","title":"CoLLaVO: Crayon Large Language and Vision mOdel","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11248","snapshot_observed_at":"2026-08-12T19:49:43.430211Z","title":"Collavo: Crayon large language and vision model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.430211Z"},"links":{"cited_paper":"/paper/2402.11248","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:655b538eab9d4bed8ea6ffaa32bee572123563f6507931f17116f9ecbca13705","observation_id":"e4b763a7-98c6-4ce9-939a-2904564c83d9","resolution":{"observed_at":"2026-08-12T19:49:43.430211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.435396Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.435396Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:f7de02e1c4a896d858c57afd0b8d533cd45d7d03c7a6a12b91a7c5f06e9ced1e","observation_id":"507369f4-f904-498e-9ab2-1e0469f59ca3","resolution":{"observed_at":"2026-08-12T19:49:43.435396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12475","last_updated":"2024-08-22T15:13:27Z","snapshot_observed_at":"2026-08-16T13:24:33.749954Z","submitted_at":"2024-08-22T15:13:27Z","title":"Frame Order Matters: A Temporal Sequence-Aware Model for Few-Shot Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12475","snapshot_observed_at":"2026-08-12T19:49:43.440209Z","title":"Frame order matters: A temporal sequence-aware model for few-shot action recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.440209Z"},"links":{"cited_paper":"/paper/2408.12475","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:53eb2ee9b825f4306713dd3f256448637b9a850d98c2a2e12ec1b136e7d5d6d4","observation_id":"59561a61-f99b-4cab-94b1-5289163a3801","resolution":{"observed_at":"2026-08-12T19:49:43.440209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T19:49:43.444946Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.444946Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:2b7cb441cd2fe40b6e3dc0e7a348db7debcf4613825fadc3b39b5b5aacf3b094","observation_id":"f957d1ad-6ae8-4ea1-b745-919a0d9f1367","resolution":{"observed_at":"2026-08-12T19:49:43.444946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08282","last_updated":"2025-06-01T17:32:19Z","snapshot_observed_at":"2026-08-18T08:40:40.305799Z","submitted_at":"2025-01-14T17:58:12Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08282","snapshot_observed_at":"2026-08-12T19:49:43.450680Z","title":"Llava-st: A multimodal large language model for fine-grained spatial- temporal understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.450680Z"},"links":{"cited_paper":"/paper/2501.08282","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:11cbb03cf93d3959eb85a57ce76098a843750292d2ba437781f5b8cbf8dd4dc4","observation_id":"0d53bb1b-9d8d-4f2d-893c-463e4dea03e7","resolution":{"observed_at":"2026-08-12T19:49:43.450680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.455776Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.455776Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:d9f90b94feaa4e37d9fc4893f1aed62dfbb50c4ca0fd523c597fcbf8cf62b172","observation_id":"09a2978a-0dab-4de4-80b6-81a87fd1baf6","resolution":{"observed_at":"2026-08-12T19:49:43.455776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.460835Z","title":"Learning semantic- aligned feature representation for text-based person search","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.460835Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:ead326308791f718e7725efe7d5d9c878e27f6ec26daa2b3d297ef9a5383a3ab","observation_id":"c62509b5-0f60-4f87-b29d-4971869331d7","resolution":{"observed_at":"2026-08-12T19:49:43.460835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.465697Z","title":"Tea: Temporal excitation and aggregation for action recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.465697Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:4e88c12abfd022296eab8c98de56410c4da41035e7b7e8bc8a498b7a3d4c8b9f","observation_id":"b68bf659-b23a-4b9d-9e04-349e81444b5a","resolution":{"observed_at":"2026-08-12T19:49:43.465697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06071","last_updated":"2024-03-05T14:36:12Z","snapshot_observed_at":"2026-08-16T14:28:08.750904Z","submitted_at":"2024-01-11T17:41:57Z","title":"GroundingGPT:Language Enhanced Multi-modal Grounding Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06071","snapshot_observed_at":"2026-08-12T19:49:43.470442Z","title":"Groundinggpt: Language enhanced multi-modal grounding model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.470442Z"},"links":{"cited_paper":"/paper/2401.06071","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:20dc2f41cca69bb84b11fed72fb58d3112b1c5cdc28622558444730e83c3f404","observation_id":"a4355b3d-2707-4492-aa59-d4862cef34b0","resolution":{"observed_at":"2026-08-12T19:49:43.470442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:45.213008Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":"d583641c-01df-4425-9733-06359812fe5d","year":2023},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.475415Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:4c1580c13b93725feeda31b9f58394e937d2eb0a9ae3724a15e7fe237cd73164","observation_id":"2fbc9ea8-719a-4696-b2e4-2b25d120c80e","resolution":{"observed_at":"2026-08-12T19:49:45.217964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.480438Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.480438Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:5a6b600c9ce92802e91caaf75496cfa94c17ff992a14778861ce2ef3edd9a780","observation_id":"bcdd80b3-b468-44fa-b79a-3af037fee7c3","resolution":{"observed_at":"2026-08-12T19:49:43.480438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.485503Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.485503Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:1b38559aa768d2e9b589206267001f577270454ead63663deab53ddf9342cbe7","observation_id":"2a41c13f-4a9c-4a74-b462-dbe3afec3864","resolution":{"observed_at":"2026-08-12T19:49:43.485503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06158","last_updated":"2024-08-12T13:55:46Z","snapshot_observed_at":"2026-08-18T11:32:14.663043Z","submitted_at":"2024-08-12T13:55:46Z","title":"OmniCLIP: Adapting CLIP for Video Recognition with Spatial-Temporal Omni-Scale Feature Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06158","snapshot_observed_at":"2026-08-12T19:49:43.490402Z","title":"Omniclip: Adapt- ing clip for video recognition with spatial-temporal omni- scale feature learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.490402Z"},"links":{"cited_paper":"/paper/2408.06158","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:6ee7aaf4ed247297aff1e7baec09e21b2362c66a2a8400793cdf206792c393e5","observation_id":"cb8adf0e-8be9-40d2-becf-9fa385417219","resolution":{"observed_at":"2026-08-12T19:49:43.490402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:45.174161Z","title":"General- ized video anomaly event detection: Systematic taxonomy and comparison of deep models","venue":null,"work_id":"2046e269-8ba5-427f-ac90-6e711eda8a7e","year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.495792Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:5bf49f1e6e93e304e154764b2f46500f0d7f1bd347a3d04ecc60ed99d39b521e","observation_id":"6b993de5-2630-46c2-9c65-e5c372cc7511","resolution":{"observed_at":"2026-08-12T19:49:45.179638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:45.156610Z","title":"Zero-shot model diagnosis","venue":null,"work_id":"1837e74b-05d6-49ad-8920-e272f013b3d1","year":2023},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.500708Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:4e7806f47f28afe5c10263377b1b79ea6235121a3711b792be56f359cb830faf","observation_id":"f832ca3a-3360-413d-bd6b-fff18b756119","resolution":{"observed_at":"2026-08-12T19:49:45.161962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:45.137858Z","title":"Groma: Localized visual tokenization for grounding multimodal large language models","venue":null,"work_id":"c477c2bb-5529-48b5-b9cf-51f247f42b41","year":2025},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.505481Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:0875f9502ac91c0fd0a2cbd056a8eb6eed431a5ce8d9fe8f2ea1444f476d37d3","observation_id":"d37a9f99-af29-49d6-93c9-fc5a7b5a20d0","resolution":{"observed_at":"2026-08-12T19:49:45.143222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20339","last_updated":"2024-05-30T17:59:47Z","snapshot_observed_at":"2026-08-17T22:05:42.917382Z","submitted_at":"2024-05-30T17:59:47Z","title":"Visual Perception by Large Language Model's Weights","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20339","snapshot_observed_at":"2026-08-12T19:49:43.510176Z","title":"Visual percep- tion by large language model’s weights","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.510176Z"},"links":{"cited_paper":"/paper/2405.20339","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:dfaf0ef0c727fc83fc8f4c5e29c8874a8a0dd446db99b38f385915219e1d33c7","observation_id":"6c8126da-127e-4b33-bcbd-c8c00fd2848e","resolution":{"observed_at":"2026-08-12T19:49:43.510176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00376","last_updated":"2025-01-14T12:37:26Z","snapshot_observed_at":"2026-08-16T14:13:50.307705Z","submitted_at":"2024-03-01T09:01:53Z","title":"Spurious Feature Eraser: Stabilizing Test-Time Adaptation for Vision-Language Foundation Model","version":3},"cited_work":{"arxiv_id":"2403.00376","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.00376","snapshot_observed_at":"2026-08-12T19:49:44.105315Z","title":"Spurious Feature Eraser: Stabilizing Test-Time Adaptation for Vision-Language Foundation Model","venue":"cs.CV","work_id":"89bc37c8-0ee2-4f8c-9df0-d3bceacf12b1","year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.515735Z"},"links":{"cited_paper":"/paper/2403.00376","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:ac1f6959c50463eef6e00b73528d6c61f8b6b52b191143c1bacaf1613dfed439","observation_id":"39867ad3-f3eb-4a93-884d-f204bbca527c","resolution":{"observed_at":"2026-08-12T19:49:44.112918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-12T19:49:43.521301Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.521301Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:4ab108750e2d55407994ec93954ea8a5efb67c6bb9157e2186a1a03aba06bf15","observation_id":"792d7724-6f6b-4491-b9ad-593aef9b054c","resolution":{"observed_at":"2026-08-12T19:49:43.521301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:45.120300Z","title":"Weakly supervised video moment retrieval from text queries","venue":null,"work_id":"3f5dfc0b-8b39-48de-b5e9-480545a18e1f","year":2019},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.526201Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:cc714dbfdfc87f2796f82799034d00a263a8c064fdba26be2dc050778ed39d5e","observation_id":"005a43c2-eed4-49bb-bea5-6cebb5c9849f","resolution":{"observed_at":"2026-08-12T19:49:45.126539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:45.103635Z","title":"Interventional video ground- ing with dual contrastive learning","venue":null,"work_id":"12a35f1f-2c23-4b51-b32f-e43faff648d8","year":2021},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.530802Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:a3248ebe7c92f3538f35953a9acf09f13d752264a81d8041d2b64ff517b179c6","observation_id":"7ea4ed77-5b01-4a45-92fd-709ead73e3b9","resolution":{"observed_at":"2026-08-12T19:49:45.109006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:45.087091Z","title":"Hello gpt-4o","venue":null,"work_id":"2b6120d4-0f41-4890-a65a-9841d16ca118","year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.535375Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:81553edfec4f0dc170117aaece2d40296cea305c6bc2b76d362bf7e3ad4c1812","observation_id":"b589c9df-8b6f-4af6-930a-2ecb8547af93","resolution":{"observed_at":"2026-08-12T19:49:45.092223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-08-18T16:51:32.000170Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-12T19:49:43.539858Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.539858Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:bc4291bbde06ab824bba3151bee03fecb7de4ef426e01cc9a36a6e2e4bd3b433","observation_id":"d81928c2-bb55-4722-96b2-9db197dd2aa5","resolution":{"observed_at":"2026-08-12T19:49:43.539858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-16T14:17:41.002456Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-12T19:49:43.544990Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.544990Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:79af1ac867974abfe47bddaa65be510b22fd9fe9fc648d934a98a9593f521e3d","observation_id":"253ded45-7cf1-49f3-9645-b0508957ab5b","resolution":{"observed_at":"2026-08-12T19:49:43.544990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:45.069070Z","title":"Controllable augmentations for video representation learning","venue":null,"work_id":"61f58cf9-5ecc-4500-9076-ad408fb0e44b","year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.550723Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:17d01770f0f8c6a467f05bd4dc46c1939fc49dabf94beebf9b31362ba90b7b87","observation_id":"8f88397d-ae84-459c-a6e7-fde74adeb53c","resolution":{"observed_at":"2026-08-12T19:49:45.074341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.555412Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.555412Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:ab48d19a1bfb00a6bb099fdd37c56b7ab787b68b2cd41030bfea7e6f2dfc0b8e","observation_id":"970d9ade-5a9f-4d92-88ff-73c048c44c0b","resolution":{"observed_at":"2026-08-12T19:49:43.555412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:45.039896Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"096d1e64-340a-4e7f-a3da-f140c09d0ebc","year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.561089Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:39a845079727e83c5ad93353768744cbee8a3f49fcf566f49c36dc0af7244d79","observation_id":"55398ac1-70a7-4692-9547-ff71c03a510f","resolution":{"observed_at":"2026-08-12T19:49:45.046475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:45.021730Z","title":"Towards more unified in-context visual un- derstanding","venue":null,"work_id":"2d9c3333-486f-4ba7-830e-407398c2c6f3","year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.565725Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:2c887e0c15ccd8bc11fbfa2fadc40f195f05fdb660501bd6158597aa0ed6a52c","observation_id":"deb07073-8690-4d58-bb61-5a630f4dac5a","resolution":{"observed_at":"2026-08-12T19:49:45.027166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:45.004012Z","title":"What does clip know about a red circle? vi- sual prompt engineering for vlms","venue":null,"work_id":"7c7ffbbc-1881-4f85-bb97-ec36e6a87658","year":2023},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.570449Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:ec5621a4db6f2306faa440676a9dd51fa17e4c8e4bc352fed1abb6d52c5c0ad0","observation_id":"0c444450-b4f7-4d1d-9dbc-13a5bae980b2","resolution":{"observed_at":"2026-08-12T19:49:45.009434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T19:49:43.575901Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.575901Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:a786a3a9a7398f0f256e0e7ba4376e1d9c0cb1ed8ccaba5a727336fb37208734","observation_id":"0361c958-e6d7-46a7-894f-acddc024dae5","resolution":{"observed_at":"2026-08-12T19:49:43.575901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.580783Z","title":"Add-it: Training-free object inser- tion in images with pretrained diffusion models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.580783Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:f8abf6811b9ecaecad8f21f33f884252ba4e27ee29a0d066ddd8f8bebc7c9c90","observation_id":"6f30a34f-00be-44f9-a43e-390dfcaac459","resolution":{"observed_at":"2026-08-12T19:49:43.580783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18722","last_updated":"2024-10-13T15:19:58Z","snapshot_observed_at":"2026-08-16T13:39:17.720827Z","submitted_at":"2024-06-26T19:42:08Z","title":"Towards Open-World Grasping with Large Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18722","snapshot_observed_at":"2026-08-12T19:49:43.586214Z","title":"Towards open- world grasping with large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.586214Z"},"links":{"cited_paper":"/paper/2406.18722","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:e2b823fe165b9ba292437fc1e65028f19a031ac0ee0b4cb3ccf16484e6ed0bfc","observation_id":"640ad148-7c08-4f97-b350-e19e4b5c85f7","resolution":{"observed_at":"2026-08-12T19:49:43.586214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-16T13:12:38.920225Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-12T19:49:43.592295Z","title":"Grounded-videollm: Sharpening fine-grained tem- poral grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.592295Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:cd6841a99bcc2aa5c58c0941539038f1fb445effb47d10918ff55550290913f3","observation_id":"c8b08ce7-467b-493d-a67e-5a418909482d","resolution":{"observed_at":"2026-08-12T19:49:43.592295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.973980Z","title":"Temporal segment networks for action recognition in videos.IEEE transactions on pattern analysis and machine intelligence , 41(11):2740– 2755, 2018","venue":null,"work_id":"8a392aa6-7bd9-41db-957b-3df09d09659f","year":2018},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.598449Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:23fe6ef7c7a01ff2566da99d341db3455a9e37b3ec11d19fab2576f513a50d71","observation_id":"a039a1d3-518a-447e-b081-8ed6ad15de62","resolution":{"observed_at":"2026-08-12T19:49:44.980623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T19:49:43.604285Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.604285Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:585ce1cb2ab7931f3e0c8a73912af39c293f686da8ecebed4f287ee392e1ae2b","observation_id":"d7919a77-a927-49c0-8fcd-2534bdace045","resolution":{"observed_at":"2026-08-12T19:49:43.604285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.955475Z","title":"Visual- semantic network: a visual and semantic enhanced model for gesture recognition","venue":null,"work_id":"461d0ce4-7bda-4cae-b286-1fd95f7c0060","year":2023},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.609223Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:b457be0198e1de235d54bf03eef25b1ea7b97ecd16d3dd5e38bc7cb5c3d853a7","observation_id":"a8003260-5202-4e4f-85b8-9412403eb99f","resolution":{"observed_at":"2026-08-12T19:49:44.961107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-08-17T03:13:20.368954Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-08-12T19:49:43.614209Z","title":"Hawkeye: Training video- text llms for grounding text in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.614209Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:2c60c8353dd2263440cfdee179d3434582c063cbbccd4e08c128b2427025f9d0","observation_id":"5a20b3e7-ecab-4f1d-a804-bd3b2d5cc14e","resolution":{"observed_at":"2026-08-12T19:49:43.614209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.937530Z","title":"Omniedit: Building image editing generalist models through specialist supervision, 2024","venue":null,"work_id":"79f74bb7-78a9-4293-9a46-806af92496f9","year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.619235Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:1c539cd406a90010c800f72739b83089051ddd0931c440f3ad750965046cf87d","observation_id":"2928fbed-084a-49ff-914d-306fff890e28","resolution":{"observed_at":"2026-08-12T19:49:44.943556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-16T13:21:09.306815Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-12T19:49:43.624115Z","title":"Visual prompting in multi- modal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.624115Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:b05968b990f6a7c3925b5cc0aac325ebaa24287e62277caf257ddb694eb7eb0d","observation_id":"186fc9f2-b1e4-402a-bfff-25de3fcdb879","resolution":{"observed_at":"2026-08-12T19:49:43.624115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16539","last_updated":"2025-02-23T04:04:38Z","snapshot_observed_at":"2026-08-16T14:06:46.846383Z","submitted_at":"2024-03-25T08:31:14Z","title":"Data-Efficient 3D Visual Grounding via Order-Aware Referring","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16539","snapshot_observed_at":"2026-08-12T19:49:43.629655Z","title":"Dora: 3d visual grounding with order-aware referring","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.629655Z"},"links":{"cited_paper":"/paper/2403.16539","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:596e355797d841926135d960fc5cea231b694ee2cfe7d85f9875d671f1ea2e57","observation_id":"198c9a2a-42d1-475e-a6fa-0bee1598c4af","resolution":{"observed_at":"2026-08-12T19:49:43.629655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.920163Z","title":"A glance at in-context learning","venue":null,"work_id":"f49318be-dbff-4384-8dbb-e1db75c8911b","year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.634816Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:4ffbd978361b6244fa3a4f1560abaf0d604e7cc727aa717def5ac1a16bffe38b","observation_id":"15b4b763-163a-45b5-a43f-487c092bbcb3","resolution":{"observed_at":"2026-08-12T19:49:44.925113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12488","last_updated":"2024-07-23T07:14:54Z","snapshot_observed_at":"2026-08-16T14:08:30.849938Z","submitted_at":"2024-03-19T06:54:33Z","title":"DetToolChain: A New Prompting Paradigm to Unleash Detection Ability of MLLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12488","snapshot_observed_at":"2026-08-12T19:49:43.639447Z","title":"Det- toolchain: A new prompting paradigm to unleash detection ability of mllm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.639447Z"},"links":{"cited_paper":"/paper/2403.12488","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:fbf7d03bb1e2f34b79720373360d6a340063f12680df845479c6e9c6ca990a5f","observation_id":"6e877104-f1bb-4bc0-aa50-cf16b322ff04","resolution":{"observed_at":"2026-08-12T19:49:43.639447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08879","last_updated":"2024-12-16T03:16:59Z","snapshot_observed_at":"2026-08-13T01:37:11.297453Z","submitted_at":"2024-12-12T02:27:46Z","title":"Video Repurposing from User Generated Content: A Large-scale Dataset and Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08879","snapshot_observed_at":"2026-08-12T19:49:43.644813Z","title":"Video repurposing from user generated con- tent: A large-scale dataset and benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.644813Z"},"links":{"cited_paper":"/paper/2412.08879","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:a41d1e7508aa98dad34dbf7f97fb71f10039c6fdac73761cd81c35780acfd326","observation_id":"e1389df3-b9f4-46ed-9419-c89b6e100bb9","resolution":{"observed_at":"2026-08-12T19:49:43.644813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.902936Z","title":"Sutd-trafficqa: A question answering benchmark and an efficient network for video rea- soning over traffic events","venue":null,"work_id":"51d80a34-8c2e-4c69-be01-d8b8e4afc64e","year":2021},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.650031Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:837289feac62110b42554c3cdbf134b5819af9e35b3ccbf93487d5e334a2a51e","observation_id":"1d9beef1-7b34-4fe4-b639-afb6a8227267","resolution":{"observed_at":"2026-08-12T19:49:44.908762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.885856Z","title":"Meta spatio-temporal debiasing for video scene graph gen- eration","venue":null,"work_id":"85eb8fd2-0be3-4d9a-9092-897618b4cff6","year":2022},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.655524Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:c74b6d690bae0db58ee569346a2ac91cdccd805ddada99fa269c961b4a14a1d1","observation_id":"c99c834b-cb81-439c-aaf2-c9d88864af74","resolution":{"observed_at":"2026-08-12T19:49:44.891670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.660472Z","title":"Vid2seq: Large-scale pretraining of a vi- sual language model for dense video captioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.660472Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:530a2d1ccdc7d1d35cc73dbe23a37eeadb992ddbbf82ef1ca2f012e4851e90e1","observation_id":"6b132d9e-1fa5-467d-8084-1732054ac599","resolution":{"observed_at":"2026-08-12T19:49:43.660472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-12T19:49:43.666512Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.666512Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:ef7f7aacee2d5ed0279fb5a6c52d75cb56e3991d031ca96a815419d8e6609972","observation_id":"0d761af4-a624-420f-90d2-a8572c02712a","resolution":{"observed_at":"2026-08-12T19:49:43.666512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.858335Z","title":"Exploring diverse in-context configurations for image captioning","venue":null,"work_id":"f30bd5df-d8ea-4eb4-b563-a94597c59cc8","year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.671820Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:0e997361c5116f6b5b172982136ffc0bd0779ceba82fdafa5e4bd1bd572dba7b","observation_id":"fd5fb59f-df58-49c6-9cbb-12e8d403fb8c","resolution":{"observed_at":"2026-08-12T19:49:44.864498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.677405Z","title":"Cpt: Colorful prompt tuning for pre-trained vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.677405Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:63bba00aa12167b2abd81a3e4b552455c40a1cb25cde13dca0c5b4d11471ea2c","observation_id":"eec21f06-3239-4544-8be1-58efdbbe9566","resolution":{"observed_at":"2026-08-12T19:49:43.677405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.831185Z","title":"Visual place recognition via local affine preserving matching","venue":null,"work_id":"48375070-7527-44d3-98c7-53857992daff","year":2021},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.682207Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:37f0f422a3aea3114661ac2ed45db1e15623e889767579fbd69c72db73dfd59d","observation_id":"0ac32572-b24b-4b83-a87a-a84f1530da4d","resolution":{"observed_at":"2026-08-12T19:49:44.836887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.815181Z","title":"Neighborhood manifold preserving matching for visual place recognition","venue":null,"work_id":"085f384d-70c5-4cd7-8956-b5954a43228b","year":2022},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.687779Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:40e67014b9cdc6c55fb6c5f073ee6e40fc404bf2aff434f73f3e0629a3628183","observation_id":"375c7cc9-c1cb-4b33-8270-aa6aea22f330","resolution":{"observed_at":"2026-08-12T19:49:44.820197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.798498Z","title":"Vqne: Variational quan- tum network embedding with application to network align- ment","venue":null,"work_id":"a17c7f2f-50de-4a03-b76f-160f8622e6a3","year":2023},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.692662Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:cb75014d4df492dc977b177956a7c9b1b57044b17eff9b72325bf8b2e66732b7","observation_id":"dd6aaa0c-f58e-4d35-b0aa-e71c86ce244e","resolution":{"observed_at":"2026-08-12T19:49:44.803501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.780528Z","title":"Bridge the modality and capability gaps in vision-language model selection","venue":null,"work_id":"d76e7e54-cb78-4f5f-af7a-79b0c9e409e0","year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.697250Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:f9a58c5f58326462615b96ae9bad307d7c6607bc39d00fa6a2a0fa145b336f0c","observation_id":"0adc9ecf-94f3-49ba-a647-5a8dd444734b","resolution":{"observed_at":"2026-08-12T19:49:44.787295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.762530Z","title":"Dataset regeneration for sequential recommendation","venue":null,"work_id":"69203e8d-6c46-4877-9683-8d47c3dee6d6","year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.702773Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:87cb939e7d76587eb00b29ccdf92c632d7642c286d4649846072c2266501c9e5","observation_id":"2562db88-e2e8-4df8-aa42-7e69e0b33615","resolution":{"observed_at":"2026-08-12T19:49:44.768468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.746005Z","title":"Hierarchical video-moment retrieval and step-captioning","venue":null,"work_id":"ce7eaee6-f0b6-4142-81e5-c0deaa766aa0","year":2023},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.707228Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:c65df08a0b49760cb6f6b8efbc45345f54a801049722676f5ecd15c115733ea3","observation_id":"9878b8de-46dc-46ad-a9bb-a51c3af5f986","resolution":{"observed_at":"2026-08-12T19:49:44.751440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-12T19:49:43.711824Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.711824Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:07fabcf2b35e6268e7a61ff598256f8c48503ae7354e56437a83d670558adcfd","observation_id":"1054c9b0-a73c-4304-839d-7d6752d46d73","resolution":{"observed_at":"2026-08-12T19:49:43.711824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.728629Z","title":"Pixel adapter: A graph-based post-processing approach for scene text image super-resolution","venue":null,"work_id":"446b99e6-13ab-48c4-b4d8-b6b4dee010dc","year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.716781Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:a9bbde6a97063883d2bf13700ddc85f4bc1594ec640bbd1e1f13bdaad37de5bf","observation_id":"a6586124-9cc2-4de1-b69d-0be5a0440220","resolution":{"observed_at":"2026-08-12T19:49:44.734674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-12T19:49:43.721713Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.721713Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:24d0741e80a53f77b6715e920d30fdc6a1a8c2af97179e57d7fb42e0d443f233","observation_id":"db67889a-4ef9-412d-8c69-c44365f0aa2e","resolution":{"observed_at":"2026-08-12T19:49:43.721713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:43.727289Z","title":"Temporal action detection with structured segment networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.727289Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:2fd54a617f6f155aa61c1660ee7423bf2a4a261af9aafa3f21b2b2485ba9f1b0","observation_id":"4259b911-136d-4604-b2e9-9b7ebb1dce2b","resolution":{"observed_at":"2026-08-12T19:49:43.727289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.701847Z","title":"Multi-modal in-context learning makes an ego-evolving scene text recognizer","venue":null,"work_id":"1d48f052-c173-4d00-9f1f-0a4438b1f56f","year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.732725Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:3fc799a3028adf185c42d8b77bd6b1077c94c84a0dd1f4a3fa888ded0ed69f44","observation_id":"3ed2a69d-cf91-43cd-88f1-5f4f38caada0","resolution":{"observed_at":"2026-08-12T19:49:44.707038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12037","last_updated":"2024-03-19T14:52:28Z","snapshot_observed_at":"2026-08-17T16:18:24.097591Z","submitted_at":"2024-03-18T17:59:42Z","title":"MineDreamer: Learning to Follow Instructions via Chain-of-Imagination for Simulated-World Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12037","snapshot_observed_at":"2026-08-12T19:49:43.738235Z","title":"Mine- dreamer: Learning to follow instructions via chain-of- imagination for simulated-world control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.738235Z"},"links":{"cited_paper":"/paper/2403.12037","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:069a8a579d2121cc03d4c9bb1d495ae354cb6743af7c197244ce596c84bbf49d","observation_id":"e2ff5e7c-1844-4af8-b586-f0cd12f33379","resolution":{"observed_at":"2026-08-12T19:49:43.738235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.685709Z","title":"Moment Retrieval In the training-free (NumPro) setting, we extract frames from videos at 1 FPS, with each frame resized to a reso- lution of 336 × 336","venue":null,"work_id":"a6c1b4e9-56e2-459c-b4c5-5fae0bb5ea06","year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.743874Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:65ebd0e1063d17f33a744f97f4a1fe860a30538fb8c934827f3cde9b1a4bdfbc","observation_id":"c6e286cc-dbcc-4042-b0ac-841dd8c3d13f","resolution":{"observed_at":"2026-08-12T19:49:44.691069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.669767Z","title":"from frame 000 to frame 200","venue":null,"work_id":"b054cb62-8f4e-4bb7-950a-523adbbd19ca","year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.748806Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:2b4e0641989ac082ddbf48d422c718f5534617f98bd36cf689b217d4587da31d","observation_id":"8388b3a9-1aa1-4bb9-ac04-c541875b6ddc","resolution":{"observed_at":"2026-08-12T19:49:44.675063Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.651966Z","title":"from 2 to","venue":null,"work_id":"fbccbd05-f6d5-4089-848e-727cbede9e00","year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.754945Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:a7bc52155a9ffe11bd9c9290acd7e16b1e6f86ae34752cb4dcacf284629b16dd","observation_id":"2f45607d-5dab-4c63-ab69-f38d8f5eb138","resolution":{"observed_at":"2026-08-12T19:49:44.658471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.633818Z","title":"We use 1FPS as the sampling rate, and adopt a design of red color, font size 40, and bottom right positioning for the number prompt","venue":null,"work_id":"7d64fc0b-2673-4dc6-b302-40202f9b3813","year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.759990Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:df6b589c9d6c95ae9174ba1cf399f43a8a4c1510360e870a2190f71ab5c21091","observation_id":"04f2c49e-fe5f-4251-96e8-5e20ea4bc4e8","resolution":{"observed_at":"2026-08-12T19:49:44.639960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.615575Z","title":"The results show that our method generalizes well across various General Vid-LLMs, achieving notable improvements in both mAP and HIT@1 metrics","venue":null,"work_id":"f46c6bdd-f23a-4cb3-aa6f-f7d2bba61984","year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.765727Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:2eefce3b6cadeeed30f66e7dcb4d6e9e93d6a65b599e8defb8b740c29e69347b","observation_id":"62fd4d25-418d-44b6-8af2-9bd64dc760c0","resolution":{"observed_at":"2026-08-12T19:49:44.621085Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.598833Z","title":"While a font size of 60 achieves better Number Accu- racy than a size of 40 (Figure 5 of the main paper), it reduces Caption Accuracy and introduces more outliers","venue":null,"work_id":"1759f63d-ed56-43ae-8970-d4121b3620d0","year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.771309Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:5b854301d90d871709958ba71a7de9b543e7e1adaeac2bc7823954b0f675888f","observation_id":"2b4ca4a2-edf2-43f8-8179-dce471846824","resolution":{"observed_at":"2026-08-12T19:49:44.603843Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.582006Z","title":"10.5s”) may introduce decimals, which can increase parsing complexity for Vid-LLMs. In Tabel 9, we compare minute-level temporal annotations (e.g., “01:10","venue":null,"work_id":"899eb4c2-8933-433e-a48b-8c48d80894b5","year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.776940Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:1d864d37466abb28ebd65d348f8ca727656cfe930fc6426f73c10e62ecba0bc0","observation_id":"f9fb595a-597d-452a-9daf-29dea2b4b37d","resolution":{"observed_at":"2026-08-12T19:49:44.587142Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:49:44.564960Z","title":"Dialogue Figure 11 illustrates a real-world application of our NumPro method within the Qwen2-VL-7B model, highlighting its ability to handle complex video-based dialogue tasks","venue":null,"work_id":"7bcffd31-db2d-4c96-a647-4ad663e40291","year":null},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.782509Z"},"links":{"citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:245f06798af23e3b638bf1da096df9b8fb89ef7e1a5e8791c85d2c07039f753f","observation_id":"ac78c114-2a4a-4414-aad3-d5b181948711","resolution":{"observed_at":"2026-08-12T19:49:44.570644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T15:13:24.930934Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":4,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":101},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 101 outbound references and 6 inbound Pith citation observations for arXiv:2411.10332."}