{"as_of":"2026-08-15T12:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:494a0c83a0c5b3e27a3ab2bb39044a571321936a1236adc3688bae2ed6b28f9b","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:38:23.397829Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.09919/citation-record","integrity":"/paper/2412.09919/integrity","json":"/paper/2412.09919/citation-record.json","paper":"/paper/2412.09919"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.529985Z","title":"Accessed: 2024-09-30","venue":null,"work_id":"e748ca4a-8164-4efc-930c-bd2b8fde43e3","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.085961Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:ed3e2259ee5d33e5c90a3efedf5dab0f866b68161a69fcbc4758f9274dde6087","observation_id":"6e269592-11af-445e-aa6e-a0cf055d1045","resolution":{"observed_at":"2026-08-11T16:38:24.534530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.515721Z","title":"Flamingo: A Visual Language Model For Few-shot Learning","venue":null,"work_id":"ff9ba05f-9aa8-4cb2-a09e-6de253a8dc5d","year":2022},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.090969Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:614a2c3fa6f51f6c5a37cff9fa15d6650faeb642b51547b35dd9f826907ceca4","observation_id":"5cce60a5-a4a9-4ed6-90ef-b513cafce434","resolution":{"observed_at":"2026-08-11T16:38:24.520243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.500252Z","title":"Deepspeed-Inference: Enabling Efficient Inference of Trans- former Models at Unprecedented Scale","venue":null,"work_id":"84a1e6d7-4ffe-4854-bc36-7c4a4dc7225d","year":2022},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.095827Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:cd0f77e31aa2ce32ab7ff47b62b64fa03feddd8f2aa352c39fb9187949da20c2","observation_id":"5b1a2745-d8f5-40b8-8072-e37ceeccd44d","resolution":{"observed_at":"2026-08-11T16:38:24.505394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T16:38:23.100815Z","title":"Qwen Technical Report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.100815Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:d23626af3c7e5c20c9c23c0dd15b1c5001694ec91ab991002ccdb7bc47def38d","observation_id":"0ed46894-0977-4b78-b1a0-fcc333a4411a","resolution":{"observed_at":"2026-08-11T16:38:23.100815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.484916Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"073dc80d-b390-4014-8cf2-ff3f951d5f70","year":2021},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.106163Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:e597deb243244e1e7983be011fda3f6dc175ea58f5afcdd1f02c2c4e1ebf2949","observation_id":"24e6e467-6e9d-48d9-84df-282eb0896330","resolution":{"observed_at":"2026-08-11T16:38:24.489843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.467279Z","title":"Token Merging for Fast Stable Diffusion","venue":null,"work_id":"4bc50796-3bcc-4768-b75e-4b1c2653e624","year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.111065Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:2956db4f995ae4edcb3f995db310887622722ce334d89aa19ce5e500ba6f49ad","observation_id":"66863b66-26b1-4de9-999c-5059196ed2d0","resolution":{"observed_at":"2026-08-11T16:38:24.472817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.451657Z","title":"Token Merging: Your ViT But Faster","venue":null,"work_id":"9dd443af-fcdd-44fe-a464-509a6fe1fe22","year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.116301Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:c5867149f0c760a2cf105af73da1130c0890b1984c10d3dbf954a212f39eddc9","observation_id":"165db5d1-38ec-480f-bb5e-65fb6fdd29d3","resolution":{"observed_at":"2026-08-11T16:38:24.456825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.435581Z","title":"Dif- fusiondet: Diffusion model for object detection","venue":null,"work_id":"dd141bfb-2b98-45c3-9c8b-c49741d75c90","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.120851Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:328db0576567ee43694df13c04dd81763072d3ab11e15c6f145b0894881f4ded","observation_id":"fb4e4d0b-64f3-44c5-bbd6-066c0d878c26","resolution":{"observed_at":"2026-08-11T16:38:24.440804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-11T16:38:23.125642Z","title":"VideoLLaMA 2: Advancing Spatial- Temporal Modeling and Audio Understanding in Video- LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.125642Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:b04c9a3bf292db74397d7db88782895703d8c686c9b9dc3bd4e96c9232e34ef8","observation_id":"97cfd238-8e33-4990-bfe2-38f7dded1efd","resolution":{"observed_at":"2026-08-11T16:38:23.125642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T16:38:23.130731Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.130731Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:84f58517f3e22707718cd9ff72806cdd6e1c25d0ef09302f2e89fdb62d02db6f","observation_id":"4a20ac0e-7c12-4615-828d-320b0218b5bb","resolution":{"observed_at":"2026-08-11T16:38:23.130731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T16:38:23.135791Z","title":"The LLaMA 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.135791Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:719811ec4654205617de88dff96109c8b2a1616d259d62e91046f521b0fb126c","observation_id":"7c5aca54-ace4-42a8-8118-b1de65e80b0e","resolution":{"observed_at":"2026-08-11T16:38:23.135791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.417005Z","title":"ActivityNet: A Large-Scale Video Benchmark for Human Activity Understanding","venue":null,"work_id":"0be39ed7-20bb-41bd-867b-fc50e5d9ce54","year":2015},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.141476Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:f3ceb68b3f831ad8aa0715ecfa5b0ff7bcf782c7342544e668255199e1425f1e","observation_id":"2330e1df-0570-4baf-9e50-13fe6758d348","resolution":{"observed_at":"2026-08-11T16:38:24.422363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T16:38:23.146380Z","title":"MME:A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.146380Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:4190722b17aec66de51569239aa2ffe553140409517239a19f01ec023d3c147a","observation_id":"6c8bf51d-4b97-4f92-8a27-f03d3374c844","resolution":{"observed_at":"2026-08-11T16:38:23.146380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.402528Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models, 2024","venue":null,"work_id":"a43b2f47-7cde-44ac-b964-051e84f586ce","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.151391Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:9d2a035804268cdae7a0a27a1690bb4d48ab537cd928505d5d75d71e3f83de76","observation_id":"8781f6cb-a499-4491-b7e3-42c24537ec2a","resolution":{"observed_at":"2026-08-11T16:38:24.407378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-11T16:38:23.155758Z","title":"Video-MME: The First-Ever Com- prehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.155758Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:c8338df6ad7c453a4f3792f6ac1e4b049353f1182047f441a89def4dfb1dc502","observation_id":"3f706293-107d-4993-bbd4-e83e824ee93d","resolution":{"observed_at":"2026-08-11T16:38:23.155758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.388018Z","title":"Making the V in VQA Matter: Ele- vating the Eole of Image Understanding in Visual Question Answering","venue":null,"work_id":"34ea2f49-a034-4654-ac42-43f3739dca68","year":2017},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.160786Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:1fbb5aed29a79daf911bcf94693a326245272de1cba874dddfa793d58212a13b","observation_id":"e8f1a4dc-1609-4fb8-9d2b-03606732a319","resolution":{"observed_at":"2026-08-11T16:38:24.392962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.373198Z","title":"Vizwiz Grand Challenge: Answering Visual Questions from Blind People","venue":null,"work_id":"d078cf0f-193d-4033-aa75-93c3372fbbbe","year":2018},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.165606Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:6899b69fa0f1d19e26d32189aafe5186604c142606eddc0a7c984a8650c32139","observation_id":"f1228d8d-5a4c-4164-9e72-a3f607853442","resolution":{"observed_at":"2026-08-11T16:38:24.378034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T16:38:23.170289Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.170289Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:2e4f1f0bed899af50ba1e70e702dca6b1f46c1e3608d3c22229fcb94ae6555f2","observation_id":"6a00835a-f980-4756-a9df-70f5f278827b","resolution":{"observed_at":"2026-08-11T16:38:23.170289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.359341Z","title":"Vision-based freezing of gait detection with anatomic patch based representation","venue":null,"work_id":"390b27f0-218a-46fc-9a9d-8fc7a3e09a49","year":2018},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.175362Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:71038b40cc20393b67d19bec7de6f802753255b52090dd70b694ab65f53b72b5","observation_id":"858c5d64-c8a9-495f-be26-980af22e3251","resolution":{"observed_at":"2026-08-11T16:38:24.363992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.344007Z","title":"GQA: A New Dataset for Real-World Visual Eeasoning and Compositional Question Answering","venue":null,"work_id":"35686233-1367-4008-a22a-bb4eb6762a5c","year":2019},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.179941Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:48ea3d13bb2845cddee3c2603d4472beef68e80597ea74554192b22d1b40f8a6","observation_id":"5b56b643-4a71-4cfc-9c8a-74f0e0f86360","resolution":{"observed_at":"2026-08-11T16:38:24.349286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05736","last_updated":"2023-12-06T17:02:25Z","snapshot_observed_at":"2026-08-13T05:53:52.455716Z","submitted_at":"2023-10-09T14:10:21Z","title":"LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05736","snapshot_observed_at":"2026-08-11T16:38:23.184668Z","title":"LLMlingua: Compressing Prompts for Accel- erated Inference of Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.184668Z"},"links":{"cited_paper":"/paper/2310.05736","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:2a8fa8748cffa97e4179c8703b098f82d06c98aba86348f0e0bf658acb94cf63","observation_id":"7794ffa5-db67-469b-b98c-b57fb734b362","resolution":{"observed_at":"2026-08-11T16:38:23.184668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.328979Z","title":"Chat-univi: Unified Visual Representation Em- powers Large Language Models with Image and Video Un- derstanding","venue":null,"work_id":"97162a31-c04e-443f-befb-e467238060a6","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.189447Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:d1c0519e57924729d8607b32edfa296b44f662391657f7e24df0f7b14b3446a9","observation_id":"d3431e70-d808-426f-8882-589bf490cab8","resolution":{"observed_at":"2026-08-11T16:38:24.334087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.314621Z","title":"ReferItGame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"6fa45b7d-7575-4e7e-9459-d60074ce3722","year":2014},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.193513Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:fe069fd7c088026fcb60c5ed9426a7b18feaf98f21b7c1fd147d85c39b582dfe","observation_id":"e95e7ffa-4f76-4850-ac58-5a023780b521","resolution":{"observed_at":"2026-08-11T16:38:24.319453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.299525Z","title":"Shamma, Michael S","venue":null,"work_id":"9ca1e87d-cae8-486d-8f9e-5989e1e93a68","year":2016},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.197464Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:61033b9501e2e0f9505ce328cc8fab509305d91e922f78598f27856f7cd854d4","observation_id":"050cfcae-719a-4d2b-aa14-f9261a73546f","resolution":{"observed_at":"2026-08-11T16:38:24.303994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T16:38:23.201279Z","title":"Seed-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.201279Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:4a788af2edb440f3da73f9ddff1f16f3fb429486d43985f233d5a6ba59d9c3d5","observation_id":"68eec932-30cf-47ef-bfd9-ffb94fc0e74a","resolution":{"observed_at":"2026-08-11T16:38:23.201279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.284613Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":"94ceae41-a2e7-4265-ad63-17b72abdc6e0","year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.205522Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:cdf4ccc831eb6e62e6f074242b6d0117e6a9662ba1eb89bfc8eae21478db30f3","observation_id":"988303e2-7d51-4828-bbcf-77e5927944d9","resolution":{"observed_at":"2026-08-11T16:38:24.289534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.268615Z","title":"MVBench: A Comprehensive Multi-Modal Video Under- standing Benchmark","venue":null,"work_id":"6d3c05b3-8699-4d20-bf62-8cc52ba00379","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.209832Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:7c6a9fec3c4c5da1a6afbba1535c8638ecbf1de6e403c0fcf1eb3ebdeb2a5a01","observation_id":"06f1b6c1-cfe4-4fcd-b12b-9167853b30d2","resolution":{"observed_at":"2026-08-11T16:38:24.274403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.253255Z","title":"VidToMe: Video Token Merging for Zero-Shot Video Edit- ing","venue":null,"work_id":"cf535bda-a531-424f-ba31-4098d2dcad71","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.213617Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:dac2fd14765da61dc05c74c756052c9389a3cd3b2915e062403dd4560e0f5e25","observation_id":"518762f7-23b3-4235-92d4-4c1344c7aecb","resolution":{"observed_at":"2026-08-11T16:38:24.258141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.237778Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","venue":null,"work_id":"dd2e84a1-c891-4582-b371-84b60a6248b7","year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.217336Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:063cec8e8ba76ffa8c2dd4c70ef9c784df9fcffc4fb934a26d3d3d9c13fd66bd","observation_id":"51dd0415-e64e-4783-9a9e-fda1710687c5","resolution":{"observed_at":"2026-08-11T16:38:24.242917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.222549Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","venue":null,"work_id":"c4a0d473-7299-438a-ba83-c50973ad29bf","year":2025},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.222025Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:6f42cc430b1d63fa9384e423f4300618679661e18bf0014204b7e26d119b9063","observation_id":"92a16398-b545-44e4-8979-57ae413ca2be","resolution":{"observed_at":"2026-08-11T16:38:24.227794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T16:38:23.226456Z","title":"Video-LLaV A: Learning United Visual Repre- sentation by Alignment Before Projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.226456Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:26abeb13524fafa091911825d2a2edb37d8c959c45dfcefcb68e9eb5e66cb36d","observation_id":"2e3f976d-c981-44d5-a858-17164d855aee","resolution":{"observed_at":"2026-08-11T16:38:23.226456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.208481Z","title":"VILA: On Pre-training for Vi- sual Language Models","venue":null,"work_id":"2583e9eb-8648-4268-a3bb-21e8bcfc4d9c","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.232050Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:aab0380606a88fc2580fdc16df09fa52438e27c388409462819dfb2197c5671c","observation_id":"3f5c0778-e792-4e59-8a65-efc0971f955e","resolution":{"observed_at":"2026-08-11T16:38:24.212782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.195940Z","title":"Visual Instruction Tuning","venue":null,"work_id":"642ad627-4707-4c43-aecf-e51c8022d7cc","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.237633Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:05318799f8b5aaf8ae82f838a1367423edf2ac28ba16cce2e9f3449cc9d5f2ec","observation_id":"32ebfc29-6c55-4996-aae1-a76ca8583fbc","resolution":{"observed_at":"2026-08-11T16:38:24.199799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.181533Z","title":"MMBench: Is Your Multi-Modal Model an All-Around Player? In ECCV, pages 216–233","venue":null,"work_id":"69e66033-186e-478e-ae5d-a680f16ae52f","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.242415Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:4f2dc16a33f4989e0116bd509a10bcbfea3dcc77bc1b61fb68ac59633a9a3b82","observation_id":"07d0d442-44ae-4980-a08c-383de4b60c55","resolution":{"observed_at":"2026-08-11T16:38:24.186301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T16:38:23.247628Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.247628Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:f44fe89f23efc46264d254a5d09e6d2ef862c0a283e73e78ddc28ed92aa03e6d","observation_id":"7a9a20a6-08bb-4b17-9cb3-637fd6a280f8","resolution":{"observed_at":"2026-08-11T16:38:23.247628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.167149Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","venue":null,"work_id":"216d8cbb-e13f-4b6d-ae62-d290992b77bf","year":2022},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.252816Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:6e98cc12947b0a620f810d1472285ca15f9ae063d2714505a1e90e8282c0c943","observation_id":"7e65f279-9a63-403a-824c-3ac0e044ba28","resolution":{"observed_at":"2026-08-11T16:38:24.171875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.151305Z","title":"Autoregressive omni-aware outpainting for open- vocabulary 360-degree image generation","venue":null,"work_id":"7c924734-7c5a-4426-a20b-edda58a52661","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.257615Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:b7bb00b57f8f4117ba69ece731f782d4acf9f40990ff3c14f8eb847e9146a14d","observation_id":"548e78ee-8e54-4b6a-8702-cc6a77bc6639","resolution":{"observed_at":"2026-08-11T16:38:24.156331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-13T11:18:51.693524Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-11T16:38:23.262723Z","title":"Valley: Video Assistant with Large Language Model Enhanced Ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.262723Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:01cb544864f638cc28c988a83b0530396b082aa3c6cf42477ae407d56f18696a","observation_id":"e4ff90b6-9572-4e9e-bb04-3ebbee2a1dcc","resolution":{"observed_at":"2026-08-11T16:38:23.262723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.136864Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Mod- els","venue":null,"work_id":"a70c6821-0c15-4100-ad77-fa2cbde8b95f","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.267826Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:cb9d427eb846c07db0aac2dfae2ecd23890c9d4d43821cd45131ac46caafc265","observation_id":"f691b681-a29b-4662-b668-5adb143c233a","resolution":{"observed_at":"2026-08-11T16:38:24.141744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.121729Z","title":"Egoschema: A Diagnostic Benchmark for Bery Long-Form Video Language Understanding","venue":null,"work_id":"dbe788bf-7e0b-41cd-85ff-3e799e9e0e36","year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.273657Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:1379ae8cde82c4177f2358f5facaf673531569069e5bf94ce5675e050570ece6","observation_id":"1380e099-43ab-480b-8e23-5aa7f9838e04","resolution":{"observed_at":"2026-08-11T16:38:24.126565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.106291Z","title":"Generation and comprehension of unambiguous object descriptions, 2016","venue":null,"work_id":"9e0b5ce4-9d4a-4b82-a984-96bf640f5b00","year":2016},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.278963Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:c29414fbb1ecf1722501545b2f7af4f24184d3bbeedda1d0ad9fadc2e67a4e87","observation_id":"ddd3961b-6767-4666-8164-aac1912eaec5","resolution":{"observed_at":"2026-08-11T16:38:24.111537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.091852Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"31b2607e-a8a0-40b1-873b-70563bbf4ca5","year":2019},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.284075Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:652fc34cd43e7e01fcee7006defe9f11a5cdd85c634e4b19604f29534c1a02b0","observation_id":"185ae4d6-ef84-462f-a676-5b1346e15f11","resolution":{"observed_at":"2026-08-11T16:38:24.096536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.076427Z","title":"Perception Test: A Diagnostic Benchmark for Multimodal Video Models","venue":null,"work_id":"30e8ac52-7367-4177-8e38-448d9530c7d2","year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.289095Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:7a6f79986bace1ef966b07e074283caba06945d230a98e369cc20f17d2906f8e","observation_id":"0ae5b099-655e-46a9-b95f-99c036a5e7cf","resolution":{"observed_at":"2026-08-11T16:38:24.082201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.060685Z","title":"Learning Transferable Visual Models from Natural Language Supervi- sion","venue":null,"work_id":"905713ea-950a-491a-ad84-6a01ee74b2ed","year":2021},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.294097Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:a5cfe219e9760a317f97568cbdc512eaa8ff55b2f16fc4aeff5058f305bf49f5","observation_id":"f9c5f32d-f17c-4c41-a43f-f69bcfcbb382","resolution":{"observed_at":"2026-08-11T16:38:24.065917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.044725Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge, 2022","venue":null,"work_id":"6550d13c-08b1-42a9-a369-73ccb18c5ebc","year":2022},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.298810Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:9c01d8dc7cfe6e58fe45d600b6648af5af5375dfe55777c1b5af2bfe8a1723fc","observation_id":"f605098e-75ae-43b5-9fdf-74ae1e73dc5b","resolution":{"observed_at":"2026-08-11T16:38:24.050404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.303588Z","title":"Llava-prumerge: Adaptive Token Reduction for Efficient Large Multimodal Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.303588Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:4dfb52e74cae291738ed8a803b780f8cd9617865fdd53d701e360b98968ab28e","observation_id":"f567e276-c483-4e2b-ac6b-118259650460","resolution":{"observed_at":"2026-08-11T16:38:23.303588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.030305Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"e6dcc7b9-2b0b-4aea-a1a8-3389535002a9","year":2018},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.308314Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:7c583b3590085ff490469341f222511134539671caa3a7f51a21d09eca2a9e02","observation_id":"b534e526-2aa0-4464-8f86-c197afa5c564","resolution":{"observed_at":"2026-08-11T16:38:24.034898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.016171Z","title":"TextCaps: a Dataset for Image Captioning with Reading Comprehension, 2020","venue":null,"work_id":"742471d7-d895-4a44-b716-1954493c90bf","year":2020},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.312965Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:1c126a4282f8cc909c7a4765ebbc107dfc613e995d40b3544275c1ae16530434","observation_id":"0203478c-b5fc-41e7-a016-a25cda20fc82","resolution":{"observed_at":"2026-08-11T16:38:24.020566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.002384Z","title":"Towards VQA Models That Can Read","venue":null,"work_id":"fa0eb8d1-48eb-44e8-9008-ca5380fef0e3","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.317610Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:4eab942fbdc04e8e4090a15bffca7ce08ccd1c5b06a8795b22ffb2fee0d3edeb","observation_id":"be74fcc7-6dc7-4e10-a015-78bf9100fdce","resolution":{"observed_at":"2026-08-11T16:38:24.006513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.986587Z","title":"Moviechat: From Dense To- ken to Sparse Memory for Long Video Understanding","venue":null,"work_id":"b4202e17-c94a-47ed-834a-10363a6cf7b9","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.322443Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:c0f6ed23ace9465718f5c16657dd754a7641146cd3559b92846b7f915b887bfe","observation_id":"4c438198-f11a-4cd1-a214-35405fb7ca7a","resolution":{"observed_at":"2026-08-11T16:38:23.992233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T16:38:23.326515Z","title":"LLaMA 2: Open Foundation and Fine-tuned Chat Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.326515Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:895590c6bd25974f6409dc80d4148c5120cc117d84085a3d2f723f5e2d8b57b9","observation_id":"2d20aec9-ae63-4483-a3d9-132da3fc07ce","resolution":{"observed_at":"2026-08-11T16:38:23.326515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05819","last_updated":"2024-12-08T05:29:39Z","snapshot_observed_at":"2026-08-14T23:05:28.608576Z","submitted_at":"2024-12-08T05:29:39Z","title":"[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05819","snapshot_observed_at":"2026-08-11T16:38:23.330686Z","title":"[cls] token tells everything needed for training-free efficient mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.330686Z"},"links":{"cited_paper":"/paper/2412.05819","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:5a96a0d9f02c90df37b192d6a0de9e88defec9eaeac6b682b3803316a4ff4367","observation_id":"927d1f5a-eb39-4d25-a0d6-5dd9d7e7c996","resolution":{"observed_at":"2026-08-11T16:38:23.330686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.969952Z","title":"VisionLLM: Large Language Model is Also An Open-ended Decoder for Vision-Centric Tasks","venue":null,"work_id":"9cdebc3b-7b5f-4671-912a-53e945729e4d","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.334738Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:7296f36aaf65a74d92e7375994ac46e47660e8607a8e07828eb9b6b7519e0837","observation_id":"a58606c6-b27b-4f42-bc8c-f950dcfea81b","resolution":{"observed_at":"2026-08-11T16:38:23.975446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.954309Z","title":"LongVLM: Efficient Long Video Under- standing Via Large Language Models","venue":null,"work_id":"59d7e417-8b25-4082-a6da-2fe98046f9b6","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.338794Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:bf730f9c73741e435101ca2430daeacd7f2b12b2fb5d95b8a8febc180aff5323","observation_id":"40d9be43-8b8c-4ab3-b5f0-119fd11e7d43","resolution":{"observed_at":"2026-08-11T16:38:23.959253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.924087Z","title":"Video Question Answer- ing via Gradually Refined Attention over Appearance and Motion","venue":null,"work_id":"27e65d76-19fe-4392-aaa1-3229ef421dbe","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.346774Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:eb27585283333cd70f73d854f86460440bdde2ea23d0e190782d13f660e841b3","observation_id":"e7dd3e38-dc97-4301-ab75-fa784b31980b","resolution":{"observed_at":"2026-08-11T16:38:23.928832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T16:38:23.351205Z","title":"Qwen2 Technical Report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.351205Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:7ad8c4582644e2f8ff587a537556fd156f0c699d8013fe87780dd707e10c817c","observation_id":"ad4deac9-1809-4d49-8119-ad02323728de","resolution":{"observed_at":"2026-08-11T16:38:23.351205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14481","last_updated":"2024-03-23T03:13:35Z","snapshot_observed_at":"2026-08-13T04:55:31.898091Z","submitted_at":"2023-12-22T07:17:51Z","title":"SurgicalPart-SAM: Part-to-Whole Collaborative Prompting for Surgical Instrument Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14481","snapshot_observed_at":"2026-08-11T16:38:23.355997Z","title":"Surgicalpart- sam: Part-to-whole collaborative prompting for surgical in- strument segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.355997Z"},"links":{"cited_paper":"/paper/2312.14481","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:a170bcd216d3fdb4aa166fc25689722998f4ecb8e64f1f208e8307c5beb05bcd","observation_id":"1440bf94-3c60-4b0a-a6ba-06e2acd78b34","resolution":{"observed_at":"2026-08-11T16:38:23.355997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-11T16:38:23.360911Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.360911Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:1699bec1698a26704aa91d243e14d395229fdf9a40b5207a536b7ce43b56772c","observation_id":"8bf437b6-282a-4b7d-9fd5-9bfd9b010e8e","resolution":{"observed_at":"2026-08-11T16:38:23.360911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.909617Z","title":"LLaV A-NeXT: A Strong Zero-shot Video Understanding Model, 2024","venue":null,"work_id":"d9243704-696b-4a83-bf06-67df123fed5d","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.365795Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:6325fca5f3a0e446204fed77a8ee63fa545a642a3c9b63de0b312b4f3a4c0da1","observation_id":"de2b71cb-7949-42ce-9489-ce89004ba5e7","resolution":{"observed_at":"2026-08-11T16:38:23.914436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.892795Z","title":"Needle In A Video Haystack: A Scalable Syn- thetic Framework for Benchmarking Video MLLMs","venue":null,"work_id":"8b57ee4c-ac64-4f9f-8108-4719f5090238","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.370070Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:0269efb9560bde0a69d5b2b41a2527ec92bcddeff38f87a3de2ddd87ec0c04dc","observation_id":"2e7fbe65-0514-494c-b5a9-b5f9956e60c7","resolution":{"observed_at":"2026-08-11T16:38:23.897803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.875419Z","title":"Clip in medical imaging: A survey","venue":null,"work_id":"d70861db-14ea-49b8-9d03-ca3e98d36946","year":2025},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.374598Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:c5e1a51c301c03045625aefad611e1dcd90be0db154c6500e0b7127e7a696980","observation_id":"1d57da18-8074-49fb-bc71-4fbfdcd2012d","resolution":{"observed_at":"2026-08-11T16:38:23.880456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-14T03:13:25.123360Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-11T16:38:23.379009Z","title":"Languagebind: Extending Video-Language Pre- training to N-modality by Language-Based Semantic Align- ment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.379009Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:36257905eae62217b063103568c0a228ed8a742fe9962f61b076014bee19d33d","observation_id":"4e9f2669-99f0-4716-809f-fdfd699558a7","resolution":{"observed_at":"2026-08-11T16:38:23.379009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.859683Z","title":"A closer look at the cls token for cross-domain few-shot learning","venue":null,"work_id":"8893b0dc-12f1-4485-a3b4-44c7cc16e0b0","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.383842Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:650f0f09c64b477e1ed0639615985d39b7be5f28386876496bd89ece6618baf3","observation_id":"4f8d223f-0972-4550-9f92-406505997ab6","resolution":{"observed_at":"2026-08-11T16:38:23.864704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.844419Z","title":"Training Details We adopt a two-stage training strategy [9, 30, 33], dividing training into pretraining for modality alignment and fine- tuning for instruction tuning","venue":null,"work_id":"1eaf53a4-5af5-4cd4-b79a-e77d616f109a","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.388255Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:27baf47cab073c0779f119ccdd7d2420af8bec260496e0b74ef3e31f76408eae","observation_id":"1a170a45-5858-417e-ad21-d9e763a9e8ce","resolution":{"observed_at":"2026-08-11T16:38:23.849232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.829446Z","title":"Additional Discussion on Different Frame Se- lection Features","venue":null,"work_id":"1cdad079-fe2d-46bf-a941-26638bebc92b","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.392641Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:6210b158c8cdb66ae47826084daf218a68c2f3052f247b3f88b8551a36a4f482","observation_id":"be9a685a-eca2-48a4-a5dc-bca19ff2bb72","resolution":{"observed_at":"2026-08-11T16:38:23.834550Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.811503Z","title":"Game Science","venue":null,"work_id":"e47ed3e5-708e-4315-ba9a-fd9a91bb824a","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.397829Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:663baa7bb705275ecdc6278f8112db393ee1ec1fcaa01e6281738417d4ed3431","observation_id":"f95bd0b0-8aba-4b16-b736-e932672b0924","resolution":{"observed_at":"2026-08-11T16:38:23.817966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.938813Z","title":null,"venue":null,"work_id":"173d3665-b460-4f27-aa33-d65e13d42e66","year":2025},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":470,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.343023Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:609f6027597492efe76ecfcd88f7b2964eda699ed3d99322b8f27779bd9f88b2","observation_id":"3039831d-a05b-48b2-935a-8e8423126b96","resolution":{"observed_at":"2026-08-11T16:38:23.943843Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":19,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2412.09919."}