{"as_of":"2026-08-14T08:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e7612a20baf3bb2f9dfbf826bb931a9c0d9330376a23f94548abf76aae1ee71b","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:03:32.584154Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:37:38.250264Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":25,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11066","snapshot_observed_at":"2026-08-06T22:37:38.250264Z","title":"Ts-llava: Constructing visual to- kens through thumbnail-and-sampling for training- free video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21116","last_updated":"2025-07-08T02:46:17Z","snapshot_observed_at":"2026-08-13T07:30:29.607676Z","submitted_at":"2025-06-26T09:30:57Z","title":"IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:37:38.250264Z"},"links":{"cited_paper":"/paper/2411.11066","citing_paper":"/paper/2506.21116"},"observation_digest":"sha256:c1e3d6e6297f0116743a906243b87d2d2edf501b08934e810abfbe9ca109a812","observation_id":"f1827bc4-9c67-4cb6-ace2-6ab52c299c2a","resolution":{"observed_at":"2026-08-06T22:37:38.250264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.11066","doi":"10.4014/jmb.2411.11066","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.11066","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ts-llava: Constructing vi- sual tokens through thumbnail-and-sampling for training-free video large language models.arXiv preprint arXiv:2411.11066","venue":"Journal of Microbiology and Biotechnology","work_id":"e809db2b-6a64-4cec-9368-b18ecee8008a","year":2024},"citing_paper":{"arxiv_id":"2604.19718","last_updated":"2026-04-21T17:45:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T17:45:37Z","title":"Direct RNA sequence design under codon constraints using expressive tensor-based secondary structure models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T00:28:35.611378Z"},"links":{"cited_paper":"/paper/2411.11066","citing_paper":"/paper/2604.19718"},"observation_digest":"sha256:633ab5762530ddd49fd686782fb0f419acb5b6cc566876f638360070ae91c880","observation_id":"3bb5536f-a601-4a5b-a460-1e52aa4c1314","resolution":{"observed_at":"2026-05-10T00:29:46.584977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.11066","doi":"10.4014/jmb.2411.11066","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.11066","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ts-llava: Constructing vi- sual tokens through thumbnail-and-sampling for training-free video large language models.arXiv preprint arXiv:2411.11066","venue":"Journal of Microbiology and Biotechnology","work_id":"e809db2b-6a64-4cec-9368-b18ecee8008a","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-08-05T23:06:05.311364Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2411.11066","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:e87b7edb5abbeb557ba2ff71be3f71141ab1c51e42acf7daf261a04588036caf","observation_id":"bbac7741-6968-45af-9c5e-35fc5092ab46","resolution":{"observed_at":"2026-05-11T16:36:07.914366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.11066","doi":"10.4014/jmb.2411.11066","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.11066","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ts-llava: Constructing vi- sual tokens through thumbnail-and-sampling for training-free video large language models.arXiv preprint arXiv:2411.11066","venue":"Journal of Microbiology and Biotechnology","work_id":"e809db2b-6a64-4cec-9368-b18ecee8008a","year":2024},"citing_paper":{"arxiv_id":"2605.22078","last_updated":"2026-05-21T07:16:45Z","snapshot_observed_at":"2026-08-12T02:06:12.618530Z","submitted_at":"2026-05-21T07:16:45Z","title":"Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T06:16:32.972099Z"},"links":{"cited_paper":"/paper/2411.11066","citing_paper":"/paper/2605.22078"},"observation_digest":"sha256:493559c7a35849ca909fe4e6426173c4fd9d2555ca6a3229f390df7f395ec9a8","observation_id":"c5335c59-93c7-493c-a6f2-bcc8ab59db26","resolution":{"observed_at":"2026-05-22T06:21:10.852517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.11066","doi":"10.4014/jmb.2411.11066","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.11066","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ts-llava: Constructing vi- sual tokens through thumbnail-and-sampling for training-free video large language models.arXiv preprint arXiv:2411.11066","venue":"Journal of Microbiology and Biotechnology","work_id":"e809db2b-6a64-4cec-9368-b18ecee8008a","year":2024},"citing_paper":{"arxiv_id":"2606.03100","last_updated":"2026-06-04T05:13:15Z","snapshot_observed_at":"2026-08-01T16:37:35.015535Z","submitted_at":"2026-06-02T03:38:51Z","title":"Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-28T10:54:02.188634Z"},"links":{"cited_paper":"/paper/2411.11066","citing_paper":"/paper/2606.03100"},"observation_digest":"sha256:71c44b2ef6a2ee181cf3eaffe2e35faa7be19fed3ffd486ae7e6a483be9bd253","observation_id":"5348825f-e32a-4020-9bf9-db996aa84538","resolution":{"observed_at":"2026-07-02T02:26:27.047994Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.11066","doi":"10.4014/jmb.2411.11066","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.11066","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ts-llava: Constructing vi- sual tokens through thumbnail-and-sampling for training-free video large language models.arXiv preprint arXiv:2411.11066","venue":"Journal of Microbiology and Biotechnology","work_id":"e809db2b-6a64-4cec-9368-b18ecee8008a","year":2024},"citing_paper":{"arxiv_id":"2606.05917","last_updated":"2026-06-04T09:23:31Z","snapshot_observed_at":"2026-08-04T03:04:58.385559Z","submitted_at":"2026-06-04T09:23:31Z","title":"MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T01:52:33.768494Z"},"links":{"cited_paper":"/paper/2411.11066","citing_paper":"/paper/2606.05917"},"observation_digest":"sha256:0d31932cf6a1a45704601d558e7dc391e14ffad90a3fb2ea706f6dddd0bdcadb","observation_id":"9e73c270-c79c-40ff-b7cc-3c2a95686929","resolution":{"observed_at":"2026-07-02T12:46:56.879237Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11066","snapshot_observed_at":"2026-07-14T07:49:34.639380Z","title":"Ts-llava: Constructing visual tokens through thumbnail- and-sampling for training-free video large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10990","last_updated":"2026-07-13T01:27:20Z","snapshot_observed_at":"2026-08-13T07:57:35.672130Z","submitted_at":"2026-07-13T01:27:20Z","title":"TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T07:49:34.639380Z"},"links":{"cited_paper":"/paper/2411.11066","citing_paper":"/paper/2607.10990"},"observation_digest":"sha256:17da580fb3f694c0236edec1a57c0324857e93f8066048864e68ba2134b7443d","observation_id":"6464f441-c331-49fd-ad4d-a67d7c43f29b","resolution":{"observed_at":"2026-07-14T07:49:34.639380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.11066/citation-record","integrity":"/paper/2411.11066/integrity","json":"/paper/2411.11066/citation-record.json","paper":"/paper/2411.11066"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T19:03:31.904212Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:31.904212Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:ea4e8bbee5a251270c403b4f99c422c7e7c739a91a1a7bda8dfa64ff33484a19","observation_id":"49d949da-4101-48f5-88b1-b60044caf604","resolution":{"observed_at":"2026-08-12T19:03:31.904212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T19:03:31.930824Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:31.930824Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:d7cbb1834e7a63cab387e4882378d33c5cb8804af0e8a5489831f42b11cec915","observation_id":"8cf08a90-6df7-4ff9-8eb8-214db30a03f9","resolution":{"observed_at":"2026-08-12T19:03:31.930824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17430","last_updated":"2024-07-29T17:59:28Z","snapshot_observed_at":"2026-08-13T07:57:14.788572Z","submitted_at":"2024-05-27T17:59:56Z","title":"Matryoshka Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17430","snapshot_observed_at":"2026-08-12T19:03:31.940342Z","title":"Matryoshka multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:31.940342Z"},"links":{"cited_paper":"/paper/2405.17430","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:00e1fdd983d2013301d74925ae9f7282b7fb45e968a79934516bf0c57927e925","observation_id":"25aafd0b-38a8-4169-9d1f-998625a32d2d","resolution":{"observed_at":"2026-08-12T19:03:31.940342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.574554Z","title":"Collecting highly parallel data for paraphrase evaluation","venue":null,"work_id":"417c2eea-de1a-4838-af9e-8eb170b64aa8","year":2011},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:31.943621Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:7847e54c232194bb66ce2a26d99be28925a3569c579513dba965f90cace5cb1a","observation_id":"063c4c28-daa6-45c7-b103-b0989029fd18","resolution":{"observed_at":"2026-08-12T19:03:33.620276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-12T19:03:31.946661Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video- llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:31.946661Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:2253146f98bc3cfb8089a577efdbca8d1d98dcb2893f992c3b5265d98a0fd375","observation_id":"b467affe-0ee3-4eef-963e-26673668d44d","resolution":{"observed_at":"2026-08-12T19:03:31.946661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.547502Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"96b84540-fe0c-4ac2-bda7-395dc64043f1","year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:31.950260Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:bbc8867fb8735e60df7e706908822fc855d6e3af52498970e3092a54bfb05e8a","observation_id":"a3fc6f6b-dba2-4b7c-a953-ed9cda08e7cd","resolution":{"observed_at":"2026-08-12T19:03:33.550546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:31.954093Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:31.954093Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:61c49c3c6d121bc8185130d8197def03b1768376984ac98bc6a5366f02b37c36","observation_id":"86dfe8fb-1ca0-44fa-87f5-658e4ade1cf3","resolution":{"observed_at":"2026-08-12T19:03:31.954093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:31.957310Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:31.957310Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:0f4c7c0760c391fe4f8eceb661e9df9b5e6a9f9738a0d7e8e6fd09314cc32c6b","observation_id":"d835c0fa-309c-44fd-b5cd-7cf8ca2383b5","resolution":{"observed_at":"2026-08-12T19:03:31.957310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.528386Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"d0d3dc77-491a-418f-836a-d4c69a1bb8a9","year":2019},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:31.960775Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:eb143e376164aecca203b585f8f0114b3e7051ca77be584f6b29a65aebca1c0f","observation_id":"a6da4ce0-5e6d-4df6-b0ae-959caac389f5","resolution":{"observed_at":"2026-08-12T19:03:33.531487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-12T19:03:31.964048Z","title":"Video-mme: The first- ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:31.964048Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:cf9c906864376eb45792e5e516f68e749970e0df59292e4f594855d5eaf44c93","observation_id":"8c4402a2-4819-4d01-9714-55fafd592f34","resolution":{"observed_at":"2026-08-12T19:03:31.964048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19046","last_updated":"2024-03-27T22:50:48Z","snapshot_observed_at":"2026-08-13T00:43:26.044820Z","submitted_at":"2024-03-27T22:50:48Z","title":"LITA: Language Instructed Temporal-Localization Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19046","snapshot_observed_at":"2026-08-12T19:03:31.982517Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:31.982517Z"},"links":{"cited_paper":"/paper/2403.19046","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:d0a74997c4ec0b6ae70b86b1392b252dc2d5e66a648e5468c2302eb2012a4e4d","observation_id":"026bce24-78e3-4d60-abe2-19d7abe416a6","resolution":{"observed_at":"2026-08-12T19:03:31.982517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-12T19:03:32.019710Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.019710Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:b677217c29d0b7094d41aa4335b6f63c9f80a6c2dc2500d76763a7c6ae6a3727","observation_id":"bf677fb0-5780-4252-8d81-fc61ba1acf29","resolution":{"observed_at":"2026-08-12T19:03:32.019710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18406","last_updated":"2024-03-27T09:48:23Z","snapshot_observed_at":"2026-08-14T02:10:53.113390Z","submitted_at":"2024-03-27T09:48:23Z","title":"An Image Grid Can Be Worth a Video: Zero-shot Video Question Answering Using a VLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18406","snapshot_observed_at":"2026-08-12T19:03:32.050286Z","title":"An image grid can be worth a video: Zero- shot video question answering using a vlm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.050286Z"},"links":{"cited_paper":"/paper/2403.18406","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:3475597e0e5441075f209e63ab5f3d408e3c61a195742a94fa3903a7c54ecb8e","observation_id":"629b42d8-c99d-4fbf-9987-35bcecbf71c9","resolution":{"observed_at":"2026-08-12T19:03:32.050286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.520577Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"e5230bf2-8644-49fd-8df5-8c4bca59880c","year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.089359Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:aab898fd4bfa29865e4ffa3edf4c07ef468dc974b53eb8102a83e6eda1826d85","observation_id":"6fe6cce8-ec58-4c31-b4d5-83e2d9e174d4","resolution":{"observed_at":"2026-08-12T19:03:33.523341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.513274Z","title":"Inten- tqa: Context-aware video intent reasoning","venue":null,"work_id":"bef2c3fe-c5d2-4626-931e-f03fe11916c8","year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.110166Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:a53baf6be2d28de8f2b4dac11e67f3551664024297117a8cfaca573414b5f964","observation_id":"99278d1d-5ca3-4f63-9b70-514c2e126e18","resolution":{"observed_at":"2026-08-12T19:03:33.515890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-12T19:03:32.113190Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.113190Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:ec62d7c5a0d1454ea0eb845ad8c613f3432f87fdee0a2d033ddf2a313eb80f29","observation_id":"8a26ddf1-7c2f-4a28-b60b-0d06a77b490e","resolution":{"observed_at":"2026-08-12T19:03:32.113190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.505636Z","title":"Mvbench: A comprehensive multi- modal video understanding benchmark","venue":null,"work_id":"8213d663-71bd-4884-af36-2186dd92c238","year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.126048Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:25a40944dc507827012a00b45aa261e0e6ab9df7da113d45fef8d738e405ebb3","observation_id":"0eba0374-34d4-4b17-ab94-035a947aa78a","resolution":{"observed_at":"2026-08-12T19:03:33.508446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.474230Z","title":"Tgif: A new dataset and benchmark on animated gif description","venue":null,"work_id":"c389c752-1b33-4ea5-b4d4-38ee0ffa6b68","year":2016},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.156621Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:3fe01dc4b5a341f752adcd9c511c6570e0ea06385ac500a2ee371210c5e993c4","observation_id":"3e925e5b-2366-479e-93be-f68f161e4f0a","resolution":{"observed_at":"2026-08-12T19:03:33.487482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.447950Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"a855feb5-e6ab-4329-8447-e04cd54658f0","year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.162477Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:3043f980ad30241240b0c4928a2947b967af4e7778449224776c7763c7ef68de","observation_id":"48d78477-2644-40f0-8843-779fb6822449","resolution":{"observed_at":"2026-08-12T19:03:33.455390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T19:03:32.165398Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.165398Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:dbd8e5576ed5ca1a05d3c99548dbbf2c835346fbb48ae7100cc7cba93edca67a","observation_id":"966c248f-6e73-4062-bcb7-fd9abb640bb9","resolution":{"observed_at":"2026-08-12T19:03:32.165398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.360769Z","title":"Visual instruction tuning","venue":null,"work_id":"84290f31-6f37-4e18-b016-3d45439926de","year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.168388Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:3d8da3082d5db478327ea71d719dfe4b33c70b36f2d53b9fe0d254095aa41ffa","observation_id":"065f7bc0-e07a-4975-ab56-355775f5a668","resolution":{"observed_at":"2026-08-12T19:03:33.376748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.266055Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"8c080063-7413-4001-9ee4-7211558b38ba","year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.170871Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:834456e968cec17cba097b41f751be5b12d73c02d451140cafcdefa308aac0f5","observation_id":"ea3865ee-5d69-4452-8071-078583c44807","resolution":{"observed_at":"2026-08-12T19:03:33.298728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.197637Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"b114521a-bf65-4318-9bf7-3bf6c8260454","year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.173551Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:6fe4b50725431241740dc62c766691086efc9bc8f9a57821deec4c3b54ccacdf","observation_id":"6a8855a7-698c-492d-b184-4795c63dc146","resolution":{"observed_at":"2026-08-12T19:03:33.225453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.168963Z","title":"St-llm: Large language models are effective tem- poral learners","venue":null,"work_id":"1d33d9c8-9e13-47fb-a841-1fddb3891501","year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.176107Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:0123d3f9e5c64eac1ab3826af7a4271c03fb749772cb29c79927670b58f416cf","observation_id":"6fdb8bc3-08c8-4df8-8837-be660e658518","resolution":{"observed_at":"2026-08-12T19:03:33.171618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.160773Z","title":"Vista-llama: Reducing hallucination in video language models via equal distance to visual tokens","venue":null,"work_id":"24b36170-4161-449b-bde6-93f2fd4f0cde","year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.178588Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:c2fda906038553b85d5e115efccf6dd7dd7a3da0090134779e553be5ba8db64e","observation_id":"8b501599-1bf7-4069-90dc-9a65dee36862","resolution":{"observed_at":"2026-08-12T19:03:33.163744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.151728Z","title":"Video-ChatGPT: Towards detailed video un- derstanding via large vision and language models","venue":null,"work_id":"0d7b33b0-7732-4a54-9a0c-4e262b688e30","year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.181013Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:f5d03b2d1bc84c53b46928b724cdafddb54b060bb6181e57a296bf59ea0a4977","observation_id":"80b922fb-32be-4c83-9ae1-26c6f76d7b00","resolution":{"observed_at":"2026-08-12T19:03:33.155251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.142937Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":"c28b7d72-d448-4799-a43f-ee898dc08e6e","year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.184057Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:fb78fa0ce0b6f4065c52b93f38175f8b61ec4298575e7627da70f45a311c4201","observation_id":"dfa5c33a-bcac-4d8b-ac98-b59275345f64","resolution":{"observed_at":"2026-08-12T19:03:33.146272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04334","last_updated":"2024-06-06T17:59:34Z","snapshot_observed_at":"2026-08-12T23:48:29.421810Z","submitted_at":"2024-06-06T17:59:34Z","title":"DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04334","snapshot_observed_at":"2026-08-12T19:03:32.186910Z","title":"Deepstack: Deeply stacking visual tokens is surprisingly simple and ef- fective for lmms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.186910Z"},"links":{"cited_paper":"/paper/2406.04334","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:252dc720f63381e7bfedff916cc0b6506c5fe30b436ffedc934c6e23df0187c5","observation_id":"4d65746e-6007-420e-885f-691aa1ddb11d","resolution":{"observed_at":"2026-08-12T19:03:32.186910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.133821Z","title":"Nous-hermes-2-yi-34b model card, 2023","venue":null,"work_id":"574ad4fb-ec8d-4a30-ad72-2d09714ec33c","year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.190184Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:3b08a3f14074430ee7d70122e2bc75761deff3e34341dc05ea0e19ba9f970165","observation_id":"64b4855d-4bd5-437b-a49b-481ba80a0497","resolution":{"observed_at":"2026-08-12T19:03:33.136959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:32.193233Z","title":"Gpt-4v(ision) system card, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.193233Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:8d12fe1d8aeea9482c0d9c3ae65576620e883f6e4b414a5612b8ab96c94d9341","observation_id":"f44c9f46-5076-4aaa-b059-05d27b8992af","resolution":{"observed_at":"2026-08-12T19:03:32.193233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T19:03:32.195669Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.195669Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:1679848ce531da17cc43a48e392d90a76271968a2f41178c42038c7d60d8dc1e","observation_id":"52ae98c6-b9ae-429d-85f0-971bf09715f3","resolution":{"observed_at":"2026-08-12T19:03:32.195669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:33.056427Z","title":"Introducing routing functions to vision-language parameter- efficient fine-tuning with low-rank bottlenecks","venue":null,"work_id":"aa742c17-5ad0-4597-9085-0867582afab8","year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.198582Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:e2a3d228f7f7d34f42fd1862a42117e6fb5dc35d86cdd244ba53e3048ab7b010","observation_id":"062d0e32-bcfd-44f0-b41a-f06eeae5b588","resolution":{"observed_at":"2026-08-12T19:03:33.089594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:32.201141Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.201141Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:b0f07fb795bbf64e1fb80e521b9def2153abbc4b34889b6ccf98e1c1c3990fae","observation_id":"86c645ed-e928-4f3b-b381-1124b575ed83","resolution":{"observed_at":"2026-08-12T19:03:32.201141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:32.204134Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.204134Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:9f6f0e430b5aefebd7fefb0662cec84177de79dc5d7e75e78ec71e6fb911de0d","observation_id":"8dadc60d-6921-45fb-945e-4233ee06fd1a","resolution":{"observed_at":"2026-08-12T19:03:32.204134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:32.980566Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"3a0e088c-baa3-4206-9800-dbb6076f55a4","year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.207504Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:d5b7572ea44195e3077b7ec907adf2b4511f76b8c4e51fe1789576266d20cd54","observation_id":"07b575ed-eb43-4530-9b83-7eb9ad6cbc9f","resolution":{"observed_at":"2026-08-12T19:03:32.997350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17176","last_updated":"2024-04-26T06:17:04Z","snapshot_observed_at":"2026-08-13T00:21:46.695199Z","submitted_at":"2024-04-26T06:17:04Z","title":"MovieChat+: Question-aware Sparse Memory for Long Video Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17176","snapshot_observed_at":"2026-08-12T19:03:32.209929Z","title":"Moviechat+: Question-aware sparse memory for long video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.209929Z"},"links":{"cited_paper":"/paper/2404.17176","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:913a72cac7cda1dbb5053cb8d079b44e2a0ef6332cd8ce7692e89b97fc96acc8","observation_id":"c59ad5fa-7152-4191-9dd5-9fa4c2acdc0d","resolution":{"observed_at":"2026-08-12T19:03:32.209929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T19:03:32.245623Z","title":"Llama: Open and efficient foundation lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.245623Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:3d34264b15550cb554f1210f53eb5219a2eaefd189356ad4d9d94a7d50679bfe","observation_id":"357115af-0b2a-40e2-b44d-f4237438b1d1","resolution":{"observed_at":"2026-08-12T19:03:32.245623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:32.959106Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":"028b6692-a9ed-4cbc-a990-1d5c047afa28","year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.290029Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:61b3877bf7ed24e10956200a1b90961b9ac75fe78a0656849611b8569c6f38c9","observation_id":"30c069cb-d8a1-4ee6-b41d-681485490811","resolution":{"observed_at":"2026-08-12T19:03:32.966106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:32.922467Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":"60753c12-7b88-43ac-8fbb-f5d9cd94025a","year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.393563Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:16769a15dee8bc6f92267532433c86a7da7f593674ff8a0f10ab149d255782a9","observation_id":"bd605700-9e6c-4c29-8b8d-1dabd561fca6","resolution":{"observed_at":"2026-08-12T19:03:32.940983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07798","last_updated":"2024-06-10T13:55:21Z","snapshot_observed_at":"2026-08-13T00:08:51.202655Z","submitted_at":"2024-05-13T14:42:13Z","title":"FreeVA: Offline MLLM as Training-Free Video Assistant","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07798","snapshot_observed_at":"2026-08-12T19:03:32.413331Z","title":"Freeva: Offline mllm as training-free video assistant","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.413331Z"},"links":{"cited_paper":"/paper/2405.07798","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:0135f98be865104f609524cbdadb9f423a5e626eea6de29ab4649c8dbcdbdf1f","observation_id":"df1c2007-d344-4dd7-9213-d609fb4ed462","resolution":{"observed_at":"2026-08-12T19:03:32.413331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08740","last_updated":"2020-03-09T00:50:19Z","snapshot_observed_at":"2026-08-09T00:43:35.974628Z","submitted_at":"2020-01-23T18:59:46Z","title":"Audiovisual SlowFast Networks for Video Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08740","snapshot_observed_at":"2026-08-12T19:03:32.416966Z","title":"Audiovisual slowfast networks for video recognition","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.416966Z"},"links":{"cited_paper":"/paper/2001.08740","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:76360a45feffcde4a17137497e8159b16aadb877da1555207b03e152fcc82bbc","observation_id":"d8aa5db7-4889-491b-9f80-ac9b2b609948","resolution":{"observed_at":"2026-08-12T19:03:32.416966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:32.420208Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.420208Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:c56b9ec8838c6c46b672b16882dc5a34a63c1b96eace2d67baecfe9272bad8fc","observation_id":"9e9814f2-3e7a-495e-96e7-e2c7504d0be3","resolution":{"observed_at":"2026-08-12T19:03:32.420208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:32.893649Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"c3d6ec5f-9a00-453a-8c06-40d5602686a5","year":2016},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.424070Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:28241b92cbdbf93bd8a4b2e24b948ed73013bd47f8958067b13b3a672bbeb9a2","observation_id":"454efdcd-bade-450b-947b-92cdef74de9b","resolution":{"observed_at":"2026-08-12T19:03:32.897591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-12T19:03:32.426845Z","title":"Pllava : Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.426845Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:58791d1da9544264295f424fd8ba0bb5728f88e4edd570ba00e02289291855ad","observation_id":"960ececd-5f18-4a8c-8b78-dfb1f4466133","resolution":{"observed_at":"2026-08-12T19:03:32.426845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-13T07:57:16.456717Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-12T19:03:32.430071Z","title":"Slowfast-llava: A strong training-free base- line for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.430071Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:8b0c74c411b30ae9a1c4728276d7b3a0a3f77c7436d9440b03f7bbd5d0c3c7c5","observation_id":"90f4958e-b8eb-4ca9-80d1-ca51d38a00e1","resolution":{"observed_at":"2026-08-12T19:03:32.430071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-12T19:03:32.433441Z","title":"10 mplug-owl: Modularization empowers large language mod- els with multimodality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.433441Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:3f9ab9ddc787b3f7e4c98f7dfeed21702ba27d6d8b580e50ca4754e510ff860b","observation_id":"6bf81f57-f298-49cd-a8ba-365e17bce8b4","resolution":{"observed_at":"2026-08-12T19:03:32.433441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:32.884932Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"ec3efd38-2748-4304-aef8-c02da970b855","year":2019},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.436405Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:b1a8a692fee0c6ea8dc097d7b0fd0d9f8cc6bbc23b6708318bd0263337e43e40","observation_id":"f7504c50-82e8-4672-a0e5-d1691be65961","resolution":{"observed_at":"2026-08-12T19:03:32.888047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17235","last_updated":"2024-10-10T05:17:00Z","snapshot_observed_at":"2026-08-13T04:52:38.290684Z","submitted_at":"2023-12-28T18:58:01Z","title":"A Simple LLM Framework for Long-Range Video Question-Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17235","snapshot_observed_at":"2026-08-12T19:03:32.439057Z","title":"A sim- ple llm framework for long-range video question-answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.439057Z"},"links":{"cited_paper":"/paper/2312.17235","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:cd9b3b36080be8d62f2742456938b4f1850f9797f95cd4401fa2925cacc9ce54","observation_id":"0c2cd52a-0aeb-411f-8a50-df560546a403","resolution":{"observed_at":"2026-08-12T19:03:32.439057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:32.875473Z","title":"Video-LLaMA: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":"f1ff8c4f-c2cc-4b3d-8836-b22eb277a50d","year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.442459Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:0b04b8ff73dac5584a7b5c5453c6c37fa775fd5ac6b91751b23a75290e322407","observation_id":"5251b9e7-9c04-4f8d-80a2-baca23deffc2","resolution":{"observed_at":"2026-08-12T19:03:32.878571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-12T19:03:32.445716Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.445716Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:4681e9a8d6ac2c2d4e9157c93214037f9a79a393acddeb9aad839f52ab28351e","observation_id":"d5f31825-3ca4-46ec-9b5c-2aa88069d694","resolution":{"observed_at":"2026-08-12T19:03:32.445716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:32.449162Z","title":"LLaMA-adapter: Efficient fine-tuning of large language models with zero- initialized attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.449162Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:51281e64019f482b4af3355310b592c8807711afaeb1ec2a6261f3270a1840e0","observation_id":"ff5e4446-e2bd-4034-9277-7defca510274","resolution":{"observed_at":"2026-08-12T19:03:32.449162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:32.856411Z","title":"Llava- next: A strong zero-shot video understanding model, 2024","venue":null,"work_id":"b67ad35d-309e-4bd2-90be-6615b148d502","year":2024},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.452314Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:963335eabbc4a95f100fda9cf10724f4ebba3c0ad1a254edce8697dc83b46ced","observation_id":"e7f5868a-7c34-4aeb-9f05-91b1058f5499","resolution":{"observed_at":"2026-08-12T19:03:32.861900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-12T19:03:32.455173Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.455173Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:2f610c0f62bd72753b966bb80676648e87d8c31299a4f610e7f4247880cdb022","observation_id":"9290f609-327a-4826-870a-9b568ad1d897","resolution":{"observed_at":"2026-08-12T19:03:32.455173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T19:03:32.482619Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.482619Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:46706121420af9b35e77fd702f653a159317bfcee5a58f1642ecea5e93258bad","observation_id":"9bd6bf4a-077d-435c-897b-011540ce64f1","resolution":{"observed_at":"2026-08-12T19:03:32.482619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:32.847806Z","title":"Each frame is resized accordingly to fit within the resulting 336 ×336 thumbnail image","venue":null,"work_id":"1d6ac7d7-5153-4108-90c2-7fa0532091f5","year":null},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.513984Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:1a73e224dab8113966499f981a6b6db32c0e369a8bad8fe7428a041b0ebd3dd8","observation_id":"5fb455bb-ce26-4a11-aed0-35a49164e72f","resolution":{"observed_at":"2026-08-12T19:03:32.850844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:32.831510Z","title":"We start with additional experiments conducted for the study on compression strategies","venue":null,"work_id":"a71e8d23-8821-4fb1-80ec-f24918dc4993","year":null},"citing_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T19:03:32.584154Z"},"links":{"citing_paper":"/paper/2411.11066"},"observation_digest":"sha256:04ac5e8deca53621b9c82a8c27b3b03c6d83ff09bfb69830470ebba8a006386f","observation_id":"6f72a5fd-f31a-4f6d-8dfb-366a28852cda","resolution":{"observed_at":"2026-08-12T19:03:32.839951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T18:54:11.019511Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 7 inbound Pith citation observations for arXiv:2411.11066."}