{"as_of":"2026-08-20T02:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:82599ffcc9578b6316568d895752c513976337b71167effd2bd603aade98f181","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:53:01.295207Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.14432/citation-record","integrity":"/paper/2504.14432/integrity","json":"/paper/2504.14432/citation-record.json","paper":"/paper/2504.14432"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T11:53:01.097617Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.097617Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:13ea14e9e307d5b2e03de2385706636531c25ca17186d125902f266f67df6bb8","observation_id":"f304bddb-a710-4735-a1f8-5705df4b77c9","resolution":{"observed_at":"2026-08-16T11:53:01.097617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T11:53:01.102120Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.102120Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:3ceb91c46f43eb00a0b6e3f16ee94ce6368b413e34b101ed06b9e0f77235a491","observation_id":"6caaec32-146f-4585-9263-2beb1770d82c","resolution":{"observed_at":"2026-08-16T11:53:01.102120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.975966Z","title":"Stanford alpaca: An instruction-following llama model,","venue":null,"work_id":"4c308812-c033-4974-a583-71626bd06fae","year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.106292Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:525353a7dd55a63bcd485a491e46d58800c142a33fb4a05d17e7547d1409a02a","observation_id":"2a3d2a0a-338b-415c-8e6a-80765a7e319b","resolution":{"observed_at":"2026-08-16T11:53:01.980865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.962455Z","title":"Gpt-4 technical report,","venue":null,"work_id":"454abc2e-b999-41ab-a763-5a645bde522d","year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.110305Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:14e0bcbc88e30d783b3096357790057d78e40003d56a4114430a3d98a11e5128","observation_id":"278e9e95-9dee-48e8-b39d-177465329327","resolution":{"observed_at":"2026-08-16T11:53:01.966491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.948554Z","title":"Chatgpt,","venue":null,"work_id":"35701e56-f6ea-427b-a015-fb5085e01f36","year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.114679Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:38dc8bc636eb8d9fbecf381e8114725ee007e54862e08cbaaa91991e4edb288d","observation_id":"11e441ed-de59-4337-ad8a-b1d44cea5798","resolution":{"observed_at":"2026-08-16T11:53:01.952923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.933850Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":"3e271560-b621-409f-b671-7bac965d4f81","year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.118813Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:97c6b9949ba2ccaf0a7b09f72a0a6c73f170b4b091769163415f2c7ed665f923","observation_id":"ea945b28-4b8d-4a52-83bb-052b7efb4391","resolution":{"observed_at":"2026-08-16T11:53:01.938007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.918126Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning,","venue":null,"work_id":"7ea334ad-c10c-4348-b34a-61a2dcb9adcf","year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.123276Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:3b8841e7542f5f1a1f31a5964e7c02717658fca2ca54b21aa6da404deacac104","observation_id":"5138eca9-1058-4b8b-b10e-dc469b71be32","resolution":{"observed_at":"2026-08-16T11:53:01.923310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-16T11:53:01.127204Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.127204Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:38d08af529b52c879360ea2e0122634851e16bc39fcfec950b4cf0abbe0b16d4","observation_id":"58c22334-2aa7-4cf8-8cce-55eaece7e4bc","resolution":{"observed_at":"2026-08-16T11:53:01.127204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-16T11:53:01.131649Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.131649Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:a7d592b2e7c3c5b683d6d8d9dbae8dd37c032dd6be561f961d93fcde1fad3fc6","observation_id":"28b26283-eaf9-46c8-935a-18b9b181ab48","resolution":{"observed_at":"2026-08-16T11:53:01.131649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-16T11:53:01.135610Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.135610Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:a4817dd9397f864ab77340d87171d5f919094b53ef502c5ad631495484204964","observation_id":"8851c7de-d104-4564-a291-f29e56dfc6d4","resolution":{"observed_at":"2026-08-16T11:53:01.135610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.902295Z","title":"Locality and compositionality in zero-shot learning,","venue":null,"work_id":"f11abe4c-1032-444e-8f85-89752e393468","year":2020},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.139693Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:e29bac2f701b2c39267fc3993cbfe9bbf28577fa90cda8f54c1f5cf7982bcd3d","observation_id":"9727e838-16b8-4ad5-b237-1788a8b561ff","resolution":{"observed_at":"2026-08-16T11:53:01.908050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.885544Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"0439bb34-7272-45a8-9d83-e02a3a6c1dc6","year":2021},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.143511Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:fc3e94372805907f71ea7afd42d27fde63ba6660675f49ff2056cecb64557169","observation_id":"69adc038-f660-44f9-b7f4-27ad234afac9","resolution":{"observed_at":"2026-08-16T11:53:01.891547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-16T15:24:32.944943Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-16T11:53:01.147624Z","title":"Valley: Video assistant with large language model enhanced ability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.147624Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:f6f8b2db248dfade04aacca28a2dd6887dff689a4c15156f6fe72d1bcbf4dc4d","observation_id":"53acd390-7574-4ba7-b50f-d3af457f750e","resolution":{"observed_at":"2026-08-16T11:53:01.147624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-16T11:53:01.151813Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.151813Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:4d1060eefb1b1da77a8adceb6583f299e6fe16c236967f784baa24c7d81ac3d8","observation_id":"62ff7709-975a-40ee-8763-a6574ccff3b1","resolution":{"observed_at":"2026-08-16T11:53:01.151813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-16T11:53:01.155987Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.155987Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:c404ff7bbb05c09bd8da7d0ad328a2a2ab1808e2bd34d55a8a764fc3eb58b032","observation_id":"056694e6-9ce4-442f-9bfa-a5f452209657","resolution":{"observed_at":"2026-08-16T11:53:01.155987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-16T11:53:01.160345Z","title":"Videochat: Chat-centric video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.160345Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:fe1ce831731466b4c1f3a077cdef3182459ccdfea36464a80cae069766121b51","observation_id":"0a4cadb3-24cc-453a-8095-56a4ab63a266","resolution":{"observed_at":"2026-08-16T11:53:01.160345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-17T16:14:50.126982Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-16T11:53:01.164655Z","title":"Moviechat: From dense token to sparse mem- ory for long video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.164655Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:e64e99882e9445f8ca5628fe0e47906722d755ab942d19c67c9f390f229ffc44","observation_id":"03ea62b9-90c1-4cb6-8c93-f6389d52ae93","resolution":{"observed_at":"2026-08-16T11:53:01.164655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.871139Z","title":"Learning spatiotemporal features with 3d convolutional networks,","venue":null,"work_id":"839ca313-7b37-43c5-9a79-0814577fb54e","year":2015},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.169251Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:a800425055de5672585bf3af8900ef63676ca6be7c5208ab0f820aecca30cf62","observation_id":"f254d20a-cbfa-475c-891b-cab57b1d8224","resolution":{"observed_at":"2026-08-16T11:53:01.875686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.173628Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.173628Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:b179874a2f6545871cc9b4a82b74d98cfe6e893e8a9b895a0426406d2a0e238b","observation_id":"3e539da7-a84f-433b-a24a-2d6638754125","resolution":{"observed_at":"2026-08-16T11:53:01.173628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.848554Z","title":"Joint learning of attended zero-shot features and visual-semantic mapping,","venue":null,"work_id":"c5214896-a81f-4ad0-bf5b-7791b099d796","year":2019},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.177846Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:badc8f66c8be022560dc7435b9218f714d0173e80271f5a795fcdbce4ceb81fa","observation_id":"37d98bee-ba20-498c-9bd2-637a8cb93ba7","resolution":{"observed_at":"2026-08-16T11:53:01.853032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.08641","last_updated":"2022-07-13T00:21:46Z","snapshot_observed_at":"2026-08-16T19:05:15.880367Z","submitted_at":"2020-11-17T14:00:30Z","title":"A Review of Generalized Zero-Shot Learning Methods","version":5},"cited_work":{"arxiv_id":"2011.08641","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.08641","snapshot_observed_at":"2026-08-16T11:53:01.410779Z","title":"A Review of Generalized Zero-Shot Learning Methods","venue":"cs.CV","work_id":"b13a57f7-512c-4e24-a6e1-ba35b937a7b7","year":2020},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.182322Z"},"links":{"cited_paper":"/paper/2011.08641","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:8455ea774ec51d9fe5afc9e043987c1715cee1665acaeaf3cb50bfcc532248e4","observation_id":"20177b18-fcaa-47fa-9e5d-44a34325ea9c","resolution":{"observed_at":"2026-08-16T11:53:01.415927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.834077Z","title":"Learning a deep embedding model for zero-shot learning,","venue":null,"work_id":"232a5020-c33c-462a-bd65-2900486419c1","year":2017},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.186865Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:abeed8a65ec57ad456657f3d8ceb5753527956ad642d711fb8c3e7dfad6e5fb8","observation_id":"89429e84-b8f8-4fef-98a3-303e0fb326eb","resolution":{"observed_at":"2026-08-16T11:53:01.838532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.191017Z","title":"Video question answering via gradually refined attention over appearance and motion,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.191017Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:996be732088b9d2d9fe7e7914a82ab7972f6d7dd616cabdb3a8d3d6e45326502","observation_id":"75935a25-512b-4e67-b893-7fbb54d1b0c1","resolution":{"observed_at":"2026-08-16T11:53:01.191017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.809866Z","title":"Tgif-qa: Toward spatio- temporal reasoning in visual question answering,","venue":null,"work_id":"f7fd71f1-d60a-4980-be5e-8af6f68daa26","year":2017},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.195248Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:5c4d55acf0226fb69c09f4cb02b59b89f00b1adad8a3b45b7a1a67138fd41daf","observation_id":"bb6fc5cb-8e23-4633-ba85-5cd65e039f23","resolution":{"observed_at":"2026-08-16T11:53:01.814518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.199459Z","title":"Activitynet- qa: A dataset for understanding complex web videos via question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.199459Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:9d78463a1e055e64ec616dfff05ff8549016da4b40b21133d233315edeca7aa4","observation_id":"7b1f0db8-c479-4411-be56-cef475623f71","resolution":{"observed_at":"2026-08-16T11:53:01.199459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.786845Z","title":"Latent dirichlet allocation,","venue":null,"work_id":"f3053b5e-2a43-4247-92b8-de48490e36ce","year":2003},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.203711Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:ffe9a117ab654717a9a0cde47e31a4bdc78e67e708afc054154bdfc016706718","observation_id":"7656832f-b8f0-424e-924a-f9683f859924","resolution":{"observed_at":"2026-08-16T11:53:01.791105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.773104Z","title":"Efficient estimation of word representations in vector space,","venue":null,"work_id":"d9c10c75-6e12-463d-8a23-bb6afb7ff875","year":2013},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.208665Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:bb11e0a545fdbbfec07113b2227efab3a2d5540c479eaadb3221d9c92fbb6088","observation_id":"f78adb90-cac7-48a7-bdfb-27a7dd9b51ac","resolution":{"observed_at":"2026-08-16T11:53:01.777599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.759463Z","title":"Skip-thought vectors,","venue":null,"work_id":"e027bd47-4e4a-4be8-8234-5890ac273d11","year":2015},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.213243Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:99533d3ecbca73445bc994a6149784b23ecadd1ee4c60d28688c1c9cf1b43c96","observation_id":"93315135-3f80-4e4e-b595-389b4aede8e1","resolution":{"observed_at":"2026-08-16T11:53:01.764174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.745880Z","title":"Distributed representations of sentences and documents,","venue":null,"work_id":"fbcd8f69-5374-4bbb-9f99-4e84d931b071","year":2014},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.217700Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:a957811ee25062a44b4a27408c0c728f842cb1499ebdb13e872b9621cdabe986","observation_id":"38ce0715-2bf0-48d1-bfe7-6d0469f846b7","resolution":{"observed_at":"2026-08-16T11:53:01.750315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.732096Z","title":"A neural proba- bilistic language model,","venue":null,"work_id":"dbc0c8fd-231a-482c-a17e-fe288db6af66","year":2003},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.222235Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:db37b71223ed37f4277a93b3916bc7e07f77713b160079ffe4ca982b27e2e131","observation_id":"ff98a2ae-8787-494f-a374-ab359de1a45e","resolution":{"observed_at":"2026-08-16T11:53:01.736459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-16T11:53:01.226446Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.226446Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:95213a8f428b78d025b2cad1065c1a57cba65ff1a8a85816c7cbd3e14dde3ef3","observation_id":"0c37b4dd-802a-489e-a702-936c6219f618","resolution":{"observed_at":"2026-08-16T11:53:01.226446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06755","last_updated":"2022-03-07T12:15:15Z","snapshot_observed_at":"2026-08-16T17:21:28.458070Z","submitted_at":"2022-02-14T14:23:36Z","title":"Energy Tank-Based Policies for Robust Aerial Physical Interaction with Moving Objects","version":2},"cited_work":{"arxiv_id":"2202.06755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.06755","snapshot_observed_at":"2026-08-16T11:53:01.374057Z","title":"Energy Tank-Based Policies for Robust Aerial Physical Interaction with Moving Objects","venue":"cs.RO","work_id":"0636269a-f236-4fa1-801e-3d93bb7e8b10","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.231020Z"},"links":{"cited_paper":"/paper/2202.06755","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:36648d0e30a585d4ab273f5cd0d5ca15ae3261eb2036d9fe0181fcee461ca0b8","observation_id":"d05b9459-8a23-4a8a-bee2-7e4da5c94e42","resolution":{"observed_at":"2026-08-16T11:53:01.380764Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-16T11:53:01.235484Z","title":"Opt: Open pre-trained transformer language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.235484Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:4f1d14f53932ae80fdb1e71038c36a9efe4ffb19b08132c942c858b0ba839103","observation_id":"d39ae4f1-3396-4ae7-b745-98df744e60bc","resolution":{"observed_at":"2026-08-16T11:53:01.235484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.717122Z","title":"Flamingo: A visual language model for few-shot learning,","venue":null,"work_id":"818d7977-1f26-4c47-aebb-7e50667982ee","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.240051Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:942c58802c5656c48840412d84ef200cae8e96c1dea94ed0ae243a70a35b162b","observation_id":"70888efd-2d1a-42eb-b88f-26df1aec08d8","resolution":{"observed_at":"2026-08-16T11:53:01.721945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.704291Z","title":"Towards general purpose vision systems: An end-to-end task-agnostic vision-language architecture,","venue":null,"work_id":"085ff7be-bc94-498f-b6e9-940395b382e5","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.244201Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:8b7db9694ed0b48db15e6ac6da40c555ae94e3fe635f3a24af097456f810a747","observation_id":"b99605de-16e8-49a2-8595-5a15dac97fdf","resolution":{"observed_at":"2026-08-16T11:53:01.708291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.690063Z","title":"Class-agnostic object detection with multi-modal transformer,","venue":null,"work_id":"2886ae44-3e9f-4ff0-9e2a-1760e0e35dd8","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.248550Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:6c2bf0a15770ad5db27c8554e99e025314721cd34f2aaaaf9abb5d025d0c5de9","observation_id":"1318fc6c-a02a-4ad8-893f-e3974fc55ec3","resolution":{"observed_at":"2026-08-16T11:53:01.694600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.675821Z","title":"Bridg- ing the gap between object and image-level representations for open- vocabulary detection,","venue":null,"work_id":"c3750c00-5581-4c7c-9f60-dfb3bd7c3d95","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.253078Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:26dc3de9ec9362e5c15a9b5fc38a511798a4dd8b59c64f9d1184e9951a00e4d0","observation_id":"ad11aa57-caf0-4881-8015-e5d4f645d8a4","resolution":{"observed_at":"2026-08-16T11:53:01.679889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.661813Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip,","venue":null,"work_id":"6a29a0db-41c2-4d10-9b49-d548f198bdf1","year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.257286Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:b6290279416d3767e1418a990830cda66f09a03aa788aece672cc02d005446d0","observation_id":"c466c31f-8346-4db8-8666-49e04d9a59b0","resolution":{"observed_at":"2026-08-16T11:53:01.666490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.647487Z","title":"Language-grounded indoor 3d semantic segmentation in the wild,","venue":null,"work_id":"586d7d24-40ed-4b3b-a8fb-42377e1a6b78","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.261324Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:c59e9f0493ef2ce417c1b0f55486ff120c40861c0307ee850a90b42e3d529ebd","observation_id":"83e32dad-0985-4a08-afed-7c6f3a8c4d07","resolution":{"observed_at":"2026-08-16T11:53:01.652301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.632508Z","title":"Expanding language-image pretrained models for general video recognition,","venue":null,"work_id":"b14c94c7-574c-4d9c-a4a8-98c95888dbdc","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.265658Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:ed72b29c185aa3751cd08a359426521f6aacc25fe790ea6178f6e859779c9708","observation_id":"bdd060f2-07d9-4739-9535-d14d05633eaf","resolution":{"observed_at":"2026-08-16T11:53:01.637665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-08-18T03:30:52.103954Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-16T11:53:01.269990Z","title":"Actionclip: A new paradigm for video action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.269990Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:cfc1db200f29625610b4729ddd175660144ef4f24100b47f3d6e0cd4b6a59c0a","observation_id":"ec746aca-0426-400e-9372-d412337a601a","resolution":{"observed_at":"2026-08-16T11:53:01.269990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.617983Z","title":"Finetuned clip models are efficient video learners,","venue":null,"work_id":"91309745-80be-4530-9e80-89e719d8bedf","year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.274197Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:4cf91454de65918f1b5c6d5b3f1dbb81b56db34ba5c135193623bb87023fe0be","observation_id":"a46ef225-0370-40f3-8308-8689c32b7d34","resolution":{"observed_at":"2026-08-16T11:53:01.622589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.278352Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.278352Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:f13d720b7eec23a18510ff5aa9b9e2d907a8b4698721329d3126fbfdfd9d5931","observation_id":"8417e37e-6722-40b1-9afb-9a3f9743a26e","resolution":{"observed_at":"2026-08-16T11:53:01.278352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.282427Z","title":"Temporal segment networks: Towards good practices for deep action recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.282427Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:99ba7980a4139719bd557bed00f6f9e477aba79d665f7eb6e8e8815ef35b2c85","observation_id":"e0eebc19-9393-4a68-9cad-bba3fedf1478","resolution":{"observed_at":"2026-08-16T11:53:01.282427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.585087Z","title":"Activi- tynet: A large-scale video benchmark for human activity understanding,","venue":null,"work_id":"fcc37c00-cf4c-44e3-954e-b80d4caf38dc","year":2015},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.287245Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:970f7a698689c953b5465f9847d3f3d5bbda629f70c47dfeac008371d844502a","observation_id":"0604e75d-9422-4794-ab3b-cc9e8cf058a7","resolution":{"observed_at":"2026-08-16T11:53:01.590115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15785","last_updated":"2024-06-27T12:05:48Z","snapshot_observed_at":"2026-08-16T14:57:08.115850Z","submitted_at":"2023-09-27T16:58:35Z","title":"BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15785","snapshot_observed_at":"2026-08-16T11:53:01.291124Z","title":"One for all: Video conversation is feasible without video instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.291124Z"},"links":{"cited_paper":"/paper/2309.15785","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:fd06d7dcca22debe91c90759fdbb9b4e3ff17494829e08a19a3d5d06ccc5c22e","observation_id":"0ba76b65-e53d-49a9-8a97-f5deaed3158c","resolution":{"observed_at":"2026-08-16T11:53:01.291124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.570533Z","title":"Zero-shot video question answering via frozen bidirectional language models,","venue":null,"work_id":"7973fe24-95b2-44ee-a615-db94dcf18556","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.295207Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:dde6cd589b3b91f203b9d37ac785dd9c2e7bc03cefbb4075e441c3e4ab5100f6","observation_id":"c0097f47-a2fb-420e-999e-701f5f012d1a","resolution":{"observed_at":"2026-08-16T11:53:01.575169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T17:04:49.784306Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2504.14432."}