{"as_of":"2026-08-19T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c07ca1b7e87407aa7823f447343c525e0f6de81d2037c54e6a46d42e2160a837","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:34:39.675979Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:43:42.424641Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T15:33:51.653731Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16156","snapshot_observed_at":"2026-08-16T05:43:42.424641Z","title":"Videoorion: Tokenizing object dynamics in videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-18T17:26:52.655453Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.424641Z"},"links":{"cited_paper":"/paper/2411.16156","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:87148fae43aaf05e63aba34938eb2b70011667cbb18e4fd59c7319d2fd7097cb","observation_id":"33f7feff-207a-4e92-9c5b-053e6c498d97","resolution":{"observed_at":"2026-08-16T05:43:42.424641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16156","snapshot_observed_at":"2026-08-06T21:41:51.372359Z","title":"Videoorion: Tokenizing object dynamics in videos.arXiv preprint arXiv:2411.16156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-16T20:36:56.520212Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.372359Z"},"links":{"cited_paper":"/paper/2411.16156","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:ef2118627f5a1bd41b7190b7a34c6e6f8c5a2df394d6d8ee17a8d3c7ed3ca74a","observation_id":"a2c3ae77-95fe-4fe4-a46a-9825521193aa","resolution":{"observed_at":"2026-08-06T21:41:51.372359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"cited_work":{"arxiv_id":"2411.16156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16156","snapshot_observed_at":"2026-08-06T15:33:51.653731Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","venue":"cs.CV","work_id":"3a2b9abd-e110-4484-bac3-2c95c835e65a","year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.245773Z"},"links":{"cited_paper":"/paper/2411.16156","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:56bb24681f979945f355fd55b2d41356de8e173f96b5737ade8dc873a13c0c53","observation_id":"dc1b8b98-c779-4bba-ba14-eacaaf7e8583","resolution":{"observed_at":"2026-08-06T15:33:51.694013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.16156/citation-record","integrity":"/paper/2411.16156/integrity","json":"/paper/2411.16156/citation-record.json","paper":"/paper/2411.16156"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:39.307583Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.307583Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:ff32934046591b2add83638dc67193472f318ac057b49e86e0b1f82b3a1b5339","observation_id":"082cb338-6733-437d-8440-5807cad345cf","resolution":{"observed_at":"2026-08-12T13:34:39.307583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.873814Z","title":"Spice: Semantic propositional image cap- tion evaluation","venue":null,"work_id":"68b8b9b0-9bff-419a-aa2f-389bc6fffa83","year":2016},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.313027Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:aa0344a42595db07ac91b1f57b7189b73763417d74e411c0f5aad206bad550b4","observation_id":"af876d63-93b8-4127-b704-b78283d9d226","resolution":{"observed_at":"2026-08-12T13:34:40.878283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-16T14:03:39.369872Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-12T13:34:39.318256Z","title":"Minigpt4-video: Advancing multimodal llms for video understanding with interleaved visual-textual tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.318256Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:7bea50d4a691ef1574ca08dc3ee3b55e1e255400580afd14f5bd437d0ccd23e8","observation_id":"deaab55d-cf4c-4f53-a562-18c9852652f8","resolution":{"observed_at":"2026-08-12T13:34:39.318256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T13:34:39.323403Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.323403Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:5203be0725a32afede341e103efc27d71a1c5f6bc7add58910ab2f52801fb688","observation_id":"bf5ccdd3-4d13-4689-9b36-8a0474465e1b","resolution":{"observed_at":"2026-08-12T13:34:39.323403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.859182Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":"b0dac583-d891-4758-b670-23abe58909f2","year":2005},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.328902Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:f266291de05ba5a081efcbc62fa187d8818ca02f42e28d566a9ebb1e34015ed2","observation_id":"cc23c52c-b1bb-4bbd-a989-988ccd54b296","resolution":{"observed_at":"2026-08-12T13:34:40.863841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.843546Z","title":"O’Reilly Media, Inc","venue":null,"work_id":"fd22d13f-9ec4-4fa6-b3c9-b6fa63378814","year":2009},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.333670Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:3e9f23114d3fcaf433ff6e32d4ec9b4296a13ad1564f132bf7d08655d07c585e","observation_id":"97bff7b1-14ee-44b5-91b8-a57ddaa2f10e","resolution":{"observed_at":"2026-08-12T13:34:40.848409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-16T13:09:28.872428Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-12T13:34:39.338126Z","title":"Temporalbench: Towards fine-grained temporal understanding for multimodal video models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.338126Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:5462760ae12f417c00eb2fd8615d1428790452a295bc3178df0159425aedf276","observation_id":"a1d00ac4-016f-4473-9f03-864bc1a8fed2","resolution":{"observed_at":"2026-08-12T13:34:39.338126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:39.342772Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.342772Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:758c0208aa90d33bd2f2d2bd2d5222d5557ae400f8ff770769a35bf1e919ca4f","observation_id":"cebda45f-0aa7-48a2-8008-19870e9c55de","resolution":{"observed_at":"2026-08-12T13:34:39.342772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-12T13:34:39.348006Z","title":"Minigpt-v2: large language model as a unified interface 9 for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.348006Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:87aafad27d44205bde7b9d5980e89a379df0906a2f2a3b654c419959f58b8d5b","observation_id":"932aee05-fa87-458e-9788-4c094850c421","resolution":{"observed_at":"2026-08-12T13:34:39.348006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-12T13:34:39.353218Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.353218Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:1672823c34dbd438f0d7bfb28d9cdf7661f932c886c9f5a80e8cea155f9d7459","observation_id":"d2ae6eec-bd68-44f2-ba7a-00b1f27df4a0","resolution":{"observed_at":"2026-08-12T13:34:39.353218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02549","last_updated":"2019-06-06T12:32:55Z","snapshot_observed_at":"2026-08-18T01:11:41.405292Z","submitted_at":"2019-06-06T12:32:55Z","title":"Weakly-Supervised Spatio-Temporally Grounding Natural Sentence in Video","version":1},"cited_work":{"arxiv_id":"1906.02549","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.02549","snapshot_observed_at":"2026-08-12T13:34:40.045716Z","title":"Weakly-Supervised Spatio-Temporally Grounding Natural Sentence in Video","venue":"cs.CV","work_id":"c45a2869-56c2-4774-b957-1c0edefaaf52","year":2019},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.358365Z"},"links":{"cited_paper":"/paper/1906.02549","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:d4f7b5cda54b1bafbda65f828a968731aa1608d5ad4bbd42c2a7d769ec601e22","observation_id":"0092740a-55b1-443c-adae-32a5323b2559","resolution":{"observed_at":"2026-08-12T13:34:40.052973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.816659Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":"3a20036b-2e7c-401a-b038-233502c20163","year":2022},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.363405Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:df9eba0529410bfa4fb87b5bd4c5894bffe5d05480b90000ff58d76d81811e41","observation_id":"e861eb7f-5a85-464b-bee9-91f7f341c223","resolution":{"observed_at":"2026-08-12T13:34:40.821627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.802030Z","title":null,"venue":null,"work_id":"92dbdbe3-6d94-4b13-a494-474461f5ac35","year":2022},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.367833Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:0d8e9af65e75c219cf55a0d8f49cfbe4c97133e90a3a4a284c6dad194598af1d","observation_id":"b9669a69-5820-4882-bc4f-c4e15f5f35fd","resolution":{"observed_at":"2026-08-12T13:34:40.806599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-12T13:34:39.372277Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.372277Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:760c4641e0a9da943a221c20a641e443a1e3ccb95af27adb5a96db8935ae5fb1","observation_id":"2b9c46bf-5595-42df-9718-aad066aba0a6","resolution":{"observed_at":"2026-08-12T13:34:39.372277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.786650Z","title":"Study on density peaks clustering based on k-nearest neighbors and principal component analysis","venue":null,"work_id":"3ab688bb-dff4-4f1f-b477-014b59793f3a","year":2016},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.377036Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:00928f3ff0247ece444099c3fd65487f80d6e43cf941686bbdce276b507edc4b","observation_id":"a9c51a8f-5985-4fb2-9a44-85d4ddf0a131","resolution":{"observed_at":"2026-08-12T13:34:40.791637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T13:34:39.381626Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.381626Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:90921039cfd9532158e016d92989eb101c8ec8140e1791ac649a3d4aab489970","observation_id":"7e1ec2af-f5dd-4f42-a043-69003f616162","resolution":{"observed_at":"2026-08-12T13:34:39.381626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.770781Z","title":"Lasot: A high-quality benchmark for large-scale single ob- ject tracking","venue":null,"work_id":"33b7e435-2df1-4d48-819f-2a5807e7cb4d","year":2019},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.386610Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:221937046440af9c0bc3266a0198b2bf3fe3faf9c0cd10c006b64e0cfc9e2281","observation_id":"07554d6f-ad94-4742-b382-66b35f7d7893","resolution":{"observed_at":"2026-08-12T13:34:40.775737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-12T13:34:39.391033Z","title":"Video-mme: The first-ever compre- hensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.391033Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:d07c4a97d6dcf50632ed4ba86a0dabb693116299f0116d09e07edee9a9430cc9","observation_id":"ba229878-cdc1-4eb7-b44e-6e039950c3e3","resolution":{"observed_at":"2026-08-12T13:34:39.391033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:39.396197Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.396197Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:7cd4c1918a5451bcf6f1fba3c4ae9eb3a086322cae6186e447c6b2818b59aaa5","observation_id":"20f0309b-697f-4c1b-9de5-d049e595a65a","resolution":{"observed_at":"2026-08-12T13:34:39.396197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.745985Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":"9197b3ef-0cb9-49ad-8a25-8a0ed5da38ff","year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.400683Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:e037dfe15ab9e8ffe3d755f37ac20d022e5944c9187ee7d5e51ae6f88b1e564a","observation_id":"af730cfc-bc5f-4ac0-a6d2-ca3f8a0ada80","resolution":{"observed_at":"2026-08-12T13:34:40.750917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.731349Z","title":"Mask r-cnn","venue":null,"work_id":"6999bf16-0376-42f6-9a12-c88a929e4120","year":2017},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.405042Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:6956db6af7733a05de48a6056697d80250c4ffbe6c33c535d325bd3c1252f677","observation_id":"d2fee7f5-8897-4d27-9be6-221d9f1a8e6a","resolution":{"observed_at":"2026-08-12T13:34:40.735797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.716868Z","title":"Long short-term memory","venue":null,"work_id":"a2470316-df64-4b08-807a-2432c8878186","year":1997},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.409562Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:57858c5f8d744d318d751291b66e8cc3064ad60378683f81d0366c6cd6c22b91","observation_id":"a837cb10-ca46-4f9d-9b4f-003abde76505","resolution":{"observed_at":"2026-08-12T13:34:40.721460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.701571Z","title":"Open-set image tagging with multi-grained text su- pervision","venue":null,"work_id":"932162e9-ac30-4b5b-979f-1034743c5d93","year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.413918Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:764a928e294a1a89cdc5b9dea77bd1329715dffdb24a570e4627a333766fd828","observation_id":"4048b125-cb13-4ab1-8779-250abed61461","resolution":{"observed_at":"2026-08-12T13:34:40.706550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T13:34:39.418269Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.418269Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:758029ace7f33251d2499459ead3aa26271e84ac62f9c30b790d76e0e3ad12d0","observation_id":"27dda32e-8e56-41b3-9a0e-9e72dc2d10e2","resolution":{"observed_at":"2026-08-12T13:34:39.418269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.686633Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video under- standing","venue":null,"work_id":"a91e4863-4450-4f0f-bb9f-f6fc2982da6e","year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.422813Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:088d64bd2316aa8f0168d3c823d5fb05c118e60d727f64a87d69bc0141d568e0","observation_id":"943b5a7f-97fb-4bef-afc4-af9386306b3b","resolution":{"observed_at":"2026-08-12T13:34:40.691466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.670140Z","title":"Video-lavit: Unified video-language pre-training with decoupled visual-motional tokenization","venue":null,"work_id":"6ab06715-f9e7-4ac9-80ef-8bde444ee80d","year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.427051Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:77ee35f9459f95c685da154c319fdc338b738289d399d4b44b803261e7754f8b","observation_id":"a52bde1e-85df-45ec-a38c-8608fa117d4c","resolution":{"observed_at":"2026-08-12T13:34:40.675832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.653425Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross B","venue":null,"work_id":"03ad6c5f-7e81-4c96-9625-1800de206a94","year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.431611Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:d5e4ee84fe37e7ed90e994d14859c822a99f155e041401c5deaeff63059ed3c1","observation_id":"9b26ce3e-57e1-479e-b162-949fb9a0ecd2","resolution":{"observed_at":"2026-08-12T13:34:40.658394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T13:34:39.436086Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.436086Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:2e040be1b3dcf9e4933a365276d7a5807b23d33d596885f908ec0c6fe7a80384","observation_id":"3f710ebf-d498-47c5-91e2-489872a8fd1e","resolution":{"observed_at":"2026-08-12T13:34:39.436086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.638622Z","title":null,"venue":null,"work_id":"45271a2a-9a55-432b-b4d7-f4599950e53c","year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.440864Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:34f231771fd147774f3bd1d12204ad18ef3640350cfbffe5a4197effb77fe690","observation_id":"07656d73-a75f-4797-a617-fe01cf21ae03","resolution":{"observed_at":"2026-08-12T13:34:40.643091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-12T13:34:39.445071Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.445071Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:3138bbf980e15c37d3a81e2e79412da8584b8f58c0ca307607c215aa270fd4d0","observation_id":"e8afc645-a8f4-490b-94fe-c1f5f3c39382","resolution":{"observed_at":"2026-08-12T13:34:39.445071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.623914Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"1558ac8b-551c-4a45-81d0-ac280405017e","year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.449828Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:684b9ff005c64a70ac87c14caa479ae069d6392bb91a8263992e242157c4443e","observation_id":"e33e0842-ee4d-4e7c-b7f6-e2896ce0751e","resolution":{"observed_at":"2026-08-12T13:34:40.629027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.609661Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"c3bd5147-acd9-4c77-bfd0-b0c5b3be5760","year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.454234Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:98e5fb0a4fcb93f1357909de185515737bf119d9bbd15bd7e22150e76e9a1f3d","observation_id":"e834733b-c25a-4f95-a7ef-0e177f43659c","resolution":{"observed_at":"2026-08-12T13:34:40.614415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-16T14:39:31.347488Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-12T13:34:39.458746Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.458746Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:184f032b7bad80c2e46403d1097b56683af12595edfe7d638ee2b6bb19262bbd","observation_id":"83738e63-e9d5-4194-95c3-e3931755e1bc","resolution":{"observed_at":"2026-08-12T13:34:39.458746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T13:34:39.463434Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.463434Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:01f828665b3cfe94153ebe8a8cf267a783fc5d4fc591639797029a654bf46d88","observation_id":"43f120a1-72eb-4099-9685-eef9b93fb36c","resolution":{"observed_at":"2026-08-12T13:34:39.463434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.594700Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"7d1469c5-2249-4156-bccc-a478f1b562d5","year":2004},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.468272Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:85abcd9fbfd4a81c31a46164d259ff341e9ea414dffdce640f8ccaf4cbd2faf5","observation_id":"5d022d43-6248-497d-9e2b-0896fad80ec2","resolution":{"observed_at":"2026-08-12T13:34:40.599544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:39.472935Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.472935Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:6e5b1560cbf8b8cb1a21f8b7ed11cce0b510621e1ef1341fbc6d6a1bbc37b380","observation_id":"6dd8a0b1-f04e-40ac-9649-6e70ebf69249","resolution":{"observed_at":"2026-08-12T13:34:39.472935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.568886Z","title":"Visual instruction tuning","venue":null,"work_id":"98e6e0c3-fdb9-46e4-9863-760290fe9f94","year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.477329Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:d8e3a1d998af25fa23ee3bbf67a4ff8159396a658365a9febca3819a829e4836","observation_id":"555b8592-3df8-477c-bbd9-9ef5a4f87786","resolution":{"observed_at":"2026-08-12T13:34:40.573691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-12T13:34:39.481837Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.481837Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:c20fc11f74d84e06f3af3eb19ad9b162750c0e26a46f512e9a14c2fc84ad19df","observation_id":"5f942323-284f-4900-85b3-28d0515c65db","resolution":{"observed_at":"2026-08-12T13:34:39.481837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-16T15:24:32.944943Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-12T13:34:39.486398Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.486398Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:45367d949e73ac8141370a9b045e902891675e85e6d6504bc7c767c12c7a4fe4","observation_id":"3c47b35c-78e1-4398-81a5-ad030fec65db","resolution":{"observed_at":"2026-08-12T13:34:39.486398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.553316Z","title":"Video-chatgpt: Towards detailed video un- derstanding via large vision and language models","venue":null,"work_id":"86e27681-59a5-4f33-a963-fee0fee8a2c6","year":null},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.491672Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:5fc28ce7246b5bc10d060d806b58c8f87fb757b2c90c6c29e41b7ed09f817d0b","observation_id":"0c413464-eddd-4822-99fe-e403e55f749c","resolution":{"observed_at":"2026-08-12T13:34:40.558291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.537749Z","title":"Trackflow: Multi-object tracking with normalizing flows","venue":null,"work_id":"d97b7524-c1cd-4746-8e33-31290d8ceddc","year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.496319Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:331e7f73f723da5dd1b9df12b05fb98e13086c80cc83d062528c23884d8f412d","observation_id":"f986b07a-4e33-4c13-8e73-80c41666a413","resolution":{"observed_at":"2026-08-12T13:34:40.542588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.522691Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":"8f62208c-d53b-4339-98d1-1bc971b88b7e","year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.500910Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:c16d880bf6d9724b864469719a41bbdf72298fa6e74c441f4f662669f1869684","observation_id":"20f76415-9d50-4e21-b82c-c1e899309713","resolution":{"observed_at":"2026-08-12T13:34:40.527413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.507899Z","title":"Trackformer: Multi-object track- ing with transformers","venue":null,"work_id":"4de55fd0-47e6-47d2-9dd9-09bb18c82b7e","year":2022},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.506071Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:d5f2dd1ee0783a38de6153b7a0785836cdd195f62cdfbbd8c9e5c8b5d284d38a","observation_id":"7f15f85d-ee84-45c8-a936-81a6ae8bf117","resolution":{"observed_at":"2026-08-12T13:34:40.512988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-12T13:34:39.510390Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.510390Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:dd1b0931853a7fa4101e76f5fef29d50bbbb09b58bff686b209b61ab112d65ed","observation_id":"630eea15-fd4f-4e25-8309-fb0106e9717e","resolution":{"observed_at":"2026-08-12T13:34:39.510390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T13:34:39.515137Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.515137Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:b89298111ca14c0285b489c30dbf7cf11024d68ad63fee8b1253b74b8c5948d6","observation_id":"a4cc5ea5-f9a6-4cab-958c-95b4f237fa6a","resolution":{"observed_at":"2026-08-12T13:34:39.515137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-12T13:34:39.519690Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.519690Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:70f7906e7311035f747ac865a95f40209a2db9c98aae65e812c5809a10e7012c","observation_id":"63a552a8-a70b-4a0b-82c2-16eb36c79954","resolution":{"observed_at":"2026-08-12T13:34:39.519690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:39.523956Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.523956Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:8c6ac0cdbbcbc6b6078de1a9445096981f17d42de0dc3f4be6e0ec9e7c7a7006","observation_id":"a1011cc5-44bb-4264-86e3-48187b3cb4f8","resolution":{"observed_at":"2026-08-12T13:34:39.523956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.482956Z","title":"Per- ception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":"a0362ff3-c8b6-4ab6-a7f5-cc11bd8aa544","year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.528222Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:8da8ade296e8b18d07bce31707708e57bb25907760b4cd2ce3cd83323d07dad9","observation_id":"22a51f1b-ccec-4d26-b9ba-17290cd0476e","resolution":{"observed_at":"2026-08-12T13:34:40.487829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.468175Z","title":"Learning video object segmentation from static images","venue":null,"work_id":"4e4c5a34-7b04-4e1d-81d5-c775511e73cb","year":2017},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.532344Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:99ceb2aa77ac6c393d7b9fc0d1e407eec0ece47470e2cb9fc87481bfa44b77b9","observation_id":"c6329891-fbc4-4738-94cb-4d3a726e4484","resolution":{"observed_at":"2026-08-12T13:34:40.473007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.453998Z","title":"Towards generalizable multi-object tracking","venue":null,"work_id":"6bf95196-b78c-40a2-abc1-2fca10e3a2d4","year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.536807Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:fe1c8cb4ac7373325baa6b595dded4a51656c442f060e788b84a25f4648a618f","observation_id":"8d531abf-a8fa-4427-83f0-d229a48a7a6f","resolution":{"observed_at":"2026-08-12T13:34:40.458607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00258","last_updated":"2024-06-01T01:43:56Z","snapshot_observed_at":"2026-08-16T13:47:14.788898Z","submitted_at":"2024-06-01T01:43:56Z","title":"Artemis: Towards Referential Understanding in Complex Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00258","snapshot_observed_at":"2026-08-12T13:34:39.541560Z","title":"Artemis: Towards referential understanding in com- plex videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.541560Z"},"links":{"cited_paper":"/paper/2406.00258","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:975acdb67c44b75aa72726aae68e49ae24ffcf01defccc8fdf24d45329e95791","observation_id":"ef256bd6-26c1-47a5-b89f-56f0594d45ed","resolution":{"observed_at":"2026-08-12T13:34:39.541560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.439295Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"c0f2f91d-d4c8-4868-8688-26e3137f3eae","year":2021},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.546238Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:6e94a68b5513149654d6abff77b92377a459a5d7ad8c63cc44ef0bc2cfd67289","observation_id":"72ff083d-d8e9-4881-a019-acf7287dc668","resolution":{"observed_at":"2026-08-12T13:34:40.444157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.424475Z","title":"Girshick, Kaiming He, and Piotr Dollár","venue":null,"work_id":"c0efec77-261d-4c35-9466-5438128b1bb9","year":2020},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.550586Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:e25efa17a189f2fe6d31dc17dad7a1a2bf8900257720839a6c9b2bf811a68cf7","observation_id":"b691f4ac-b038-4075-85d5-023e827df575","resolution":{"observed_at":"2026-08-12T13:34:40.429322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-12T13:34:39.554986Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.554986Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:e9252bcec23a87e696cd45afe2d77b041f1fa60ec8bf00f9f055b1132fb2e5ed","observation_id":"41085d68-300e-4ec1-8543-0d927b5a5a7b","resolution":{"observed_at":"2026-08-12T13:34:39.554986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.409678Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"24c1d2be-5f5e-418d-a60b-d1f19f31d562","year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.559784Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:7a8d6af58cdd436b81deb16a64745f2d7ea4853056ba49a2de4eb8e374c99049","observation_id":"75c5a13f-1a39-468d-8cd4-8e9ba56ed472","resolution":{"observed_at":"2026-08-12T13:34:40.414521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.394679Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"223ee5ab-e232-49e9-a487-67bda67e4f6d","year":2022},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.564347Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:80d7835c67c74e94136896b4206919d8a87160b3d83f714016b2275ae9d5b04a","observation_id":"ddc4fce0-dfad-44e3-8ba3-5032e811122a","resolution":{"observed_at":"2026-08-12T13:34:40.399619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-08-19T01:25:12.071390Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-12T13:34:39.568890Z","title":"Audio-visual llm for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.568890Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:cc948545dd2a38d61737794cfc2171bf340d5afc212e6e7da8b302ec3e57e182","observation_id":"c6ac71a1-b325-4977-9043-49cd8aaacf96","resolution":{"observed_at":"2026-08-12T13:34:39.568890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.379043Z","title":"Human-centric spatio-temporal video grounding with visual transformers","venue":null,"work_id":"6e9884b8-af5f-4d7b-85c4-62433ae04788","year":2021},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.573964Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:471ea128c40ceed8ba4dee8ad5d1bfd1f9dabbf833e1f7fb2b07b0b8c3e0190c","observation_id":"9928d5cb-9c40-414b-a00d-4b1ceb7893ec","resolution":{"observed_at":"2026-08-12T13:34:40.383909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T13:34:39.578928Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.578928Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:cf45b7b585ca1273d3b79266be980a3c7b3536a55f36b5aadd42db6105fe8010","observation_id":"ef7c6d51-f861-41bb-8bfa-d15ffe57826f","resolution":{"observed_at":"2026-08-12T13:34:39.578928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.364434Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"129f6c64-d418-449d-8827-e363cc9b2157","year":2022},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.583883Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:cdc69c7a6646779b8cb2a5f91c57afe07ff0e7812d578055f24d05d40665677a","observation_id":"35e36e0d-49fa-4b6a-af1e-137242892064","resolution":{"observed_at":"2026-08-12T13:34:40.369223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.348726Z","title":"Attention is all you need","venue":null,"work_id":"b37a9f51-c018-4af1-b00b-55e98d123c60","year":2017},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.588317Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:643c7c7d215cbbb9c36bf385c3d9f3c4737e50187ff808cfeb511956e0526f49","observation_id":"7411bd11-f04d-447e-80ee-fc3989d1c959","resolution":{"observed_at":"2026-08-12T13:34:40.354099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.333342Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":"c462f026-1229-4e44-a470-19aff646e33b","year":2015},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.592868Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:b96fccfbc81c6d776ce4bf100d532d1641599a7304112ad6c23ab30e2cd2bec6","observation_id":"b3d6b349-5e81-4d83-964c-bae5123daf8c","resolution":{"observed_at":"2026-08-12T13:34:40.337957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.318432Z","title":"Elysium: Exploring object-level perception in videos via mllm","venue":null,"work_id":"59396ba6-769e-4889-952d-173cf90a2125","year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.597762Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:af5e29b84c9d25382dbbe7bd146ba840083e06df3ff72b1ba6263aafa98e15e1","observation_id":"f3cb8cb6-8b87-407f-a60d-5feea461e2a3","resolution":{"observed_at":"2026-08-12T13:34:40.323665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.303769Z","title":"Fast online object tracking and segmentation: A unifying approach","venue":null,"work_id":"eb2438b8-db7e-478e-8e5f-06203f2a148c","year":2019},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.602283Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:e276e4ee4e8a645ed1de9f8f3f6271e9007c905ec72aafa646130e7f18b5f17b","observation_id":"5fb45a14-08ee-4ea3-8ee4-d0de5f67d7fd","resolution":{"observed_at":"2026-08-12T13:34:40.308679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.288895Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":"abec5cc9-e915-4da5-99d9-049571545d3f","year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.606753Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:56ab74daa6493c2c51f6a137710c4081a69542b21b130b601b2def6ac426e76a","observation_id":"8e6574c4-d365-452b-b334-4bf7b58b55fe","resolution":{"observed_at":"2026-08-12T13:34:40.293812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13088","last_updated":"2024-02-20T15:30:09Z","snapshot_observed_at":"2026-08-16T14:16:55.049347Z","submitted_at":"2024-02-20T15:30:09Z","title":"Slot-VLM: SlowFast Slots for Video-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13088","snapshot_observed_at":"2026-08-12T13:34:39.611300Z","title":"Slot-vlm: Slowfast slots for video-language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.611300Z"},"links":{"cited_paper":"/paper/2402.13088","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:1811ea3b9736630e1646eed7421fec4af696ed2fe0b6e118f878feca89db9255","observation_id":"d2e85e2f-10f1-4f0e-b5ab-5d91d0d6dd13","resolution":{"observed_at":"2026-08-12T13:34:39.611300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-12T13:34:39.616540Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.616540Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:b013bd6fa0ec54b9e00947502c50db76256d63e401c851b7d117c9a6bd9f673d","observation_id":"53b2039b-2828-4a06-a1d8-2a012de8fc73","resolution":{"observed_at":"2026-08-12T13:34:39.616540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.273584Z","title":"Associating ob- jects with transformers for video object segmentation","venue":null,"work_id":"1ce30437-307c-4a00-a077-c289f4bf8bca","year":2021},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.621919Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:f84d682c40bcdb87dbf9b9405caa062b3ef970f2723f6f80e9901d6e3d129d7e","observation_id":"a5140dd1-eccf-4722-9257-f3a321c32961","resolution":{"observed_at":"2026-08-12T13:34:40.278454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:39.626487Z","title":"Detclip: Dictionary-enriched visual-concept paralleled pre- training for open-world detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.626487Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:03db00407ff7147f372c7a0ec526a0360ac3d7dbb6d30b1cf88dbaaa4c343cf0","observation_id":"db39b2ad-338f-496f-a2c0-7588327cd4a3","resolution":{"observed_at":"2026-08-12T13:34:39.626487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-12T13:34:39.630943Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.630943Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:45a8ec341f19433930332c559226f37ad4bbda57fd5bc1a7e49e2a0b86947edc","observation_id":"5a20671a-cbc3-4966-8533-f1dbd5445e5b","resolution":{"observed_at":"2026-08-12T13:34:39.630943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.248055Z","title":"Merlin: Empowering multimodal llms with foresight minds","venue":null,"work_id":"3436266d-bd2c-4801-877a-0cd4d475c053","year":2025},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.635666Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:4a90904023b4256b8edb704bbddd5fcadbd5af50c9c3acace9bcedf48f9a6196","observation_id":"fffe4e55-fa70-4c75-a895-f187e12bac3c","resolution":{"observed_at":"2026-08-12T13:34:40.253003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.232707Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"b0e63f13-34a0-4b56-ad52-6192f0ff3cd0","year":2019},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.640034Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:07c7ba2ff4d77ab2e72e6d708b6d312eec55f5a8c5af62676d8980ef3be68681","observation_id":"809c6341-9e23-46dd-8906-80cca33510bc","resolution":{"observed_at":"2026-08-12T13:34:40.238026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:39.644411Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.644411Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:a2ec67562178db272a48f59bbde512285ef1efe407aaba546d1ab480642f6ea3","observation_id":"7d14f471-a06e-4225-b9e9-e82064e228f9","resolution":{"observed_at":"2026-08-12T13:34:39.644411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.206648Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":"04117b85-a1e7-45b1-b29b-e790f6a12aa4","year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.648650Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:2e02b44d7d2cb546603bfca302536657407affeeeae27185aa2210516715bf1a","observation_id":"daa19f54-10a2-4e35-94fb-d26a5579b75c","resolution":{"observed_at":"2026-08-12T13:34:40.211398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.189984Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":"36e778a2-7eda-491c-9b77-6ef689337309","year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.653519Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:016ea58d31b95ab1be714bf947cddefa364c3edcf2045eff80a2d081695b6104","observation_id":"62c6b054-d9f2-42b2-81ef-e9de295d7600","resolution":{"observed_at":"2026-08-12T13:34:40.195553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-12T13:34:39.658034Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.658034Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:9fe272412a2955c46699782276a4a8e351cc7d57e68e5fe930b6d701e67900ef","observation_id":"bdd9b020-43cb-46c0-b9b0-895f15b28c95","resolution":{"observed_at":"2026-08-12T13:34:39.658034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.173880Z","title":"Bytetrack: Multi-object tracking by associating every detection box","venue":null,"work_id":"e3124e50-e655-4625-80d7-729e53ea5074","year":2022},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.662752Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:d94ffc42d12184296d04720b37f7074ed5cdae0af147dd4205b50d2bb5cd410f","observation_id":"e3186eee-38ad-4f2a-963b-5e476b1e2ee5","resolution":{"observed_at":"2026-08-12T13:34:40.178837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.157876Z","title":"Llava- next: A strong zero-shot video understanding model, 2024","venue":null,"work_id":"f785d44d-34f4-4b19-8074-94ba623c7565","year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.667082Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:66897b9a49df32609667a515650318324317dcc8c717b913e0c4be929d7f511a","observation_id":"d127ec19-20b0-4bb5-b547-4e297e93cb3f","resolution":{"observed_at":"2026-08-12T13:34:40.163011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:34:40.142396Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"ee42950f-133e-444e-9c3c-9f34801dbfbb","year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.671530Z"},"links":{"citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:4d17c25fb342d9ecc01aabf1345f188de7fbb9d7eca5179063d4379e5df6e642","observation_id":"0168b99f-74c3-484d-b4bc-03fefaf1fb3e","resolution":{"observed_at":"2026-08-12T13:34:40.147418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13974","last_updated":"2023-07-26T06:19:46Z","snapshot_observed_at":"2026-08-16T15:13:13.928363Z","submitted_at":"2023-07-26T06:19:46Z","title":"Tracking Anything in High Quality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13974","snapshot_observed_at":"2026-08-12T13:34:39.675979Z","title":"Tracking anything in high quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.675979Z"},"links":{"cited_paper":"/paper/2307.13974","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:e660df016e2290203e1ec48dff8a703c023f2e592e388045d8b7223f99dfa83e","observation_id":"c030980a-8153-4a00-9e49-f400e8b8c805","resolution":{"observed_at":"2026-08-12T13:34:39.675979Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":1,"verified_fuzzy":43},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 3 inbound Pith citation observations for arXiv:2411.16156."}