{"as_of":"2026-08-21T03:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b8d120e2e1b816b5f865d7c6e6c280434b5217bf679bb22b6d5d16fcb3b8d19","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:29:51.391770Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T01:52:44.785582Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T12:46:56.808179Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"cited_work":{"arxiv_id":"2412.17415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17415","snapshot_observed_at":"2026-07-02T12:46:56.808179Z","title":null,"venue":null,"work_id":"905752a9-a88e-4770-ac8e-ab82a0850b05","year":2025},"citing_paper":{"arxiv_id":"2606.05736","last_updated":"2026-06-04T05:55:15Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T05:55:15Z","title":"VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T01:52:44.785582Z"},"links":{"cited_paper":"/paper/2412.17415","citing_paper":"/paper/2606.05736"},"observation_digest":"sha256:ce244310a35c747fc3990f3d1d72988257e0190c965bf6268465d5946b336f41","observation_id":"4dccfb87-3f24-4aae-bd55-8b45679640d5","resolution":{"observed_at":"2026-07-02T12:46:56.809467Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.17415/citation-record","integrity":"/paper/2412.17415/integrity","json":"/paper/2412.17415/citation-record.json","paper":"/paper/2412.17415"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-11T05:29:51.251138Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.251138Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:d6ae9c2a19ff17e2588e2da5c53055d341686bbfd6e216584d5f8f57f37bf3e7","observation_id":"36b59a45-b65a-4919-a5fd-3d4d50acf58b","resolution":{"observed_at":"2026-08-11T05:29:51.251138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-11T05:29:51.256797Z","title":"Video-llama: An instruction- tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.256797Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:1202c5c801e107027bc8e3b11a8cb755d19acbb50220fc0f534774c630d26758","observation_id":"a0b15ddd-9712-425a-8d9b-836f8593e592","resolution":{"observed_at":"2026-08-11T05:29:51.256797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T05:29:51.261821Z","title":"Video-llava: Learning united visual representation by alignment before projection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.261821Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:fe36992474dab1c88d6a0ebfbaf2638b20420a9f87a1dafe4dbab3686722a225","observation_id":"d862ea53-59ad-4fec-a7e4-5741daf06e7c","resolution":{"observed_at":"2026-08-11T05:29:51.261821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-11T05:29:51.267504Z","title":"Video instruction tuning with synthetic data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.267504Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:3eab1f6865e5d4744464dc1a37932d354d7c95b399cc87b87ec1e4ee8da6fc4f","observation_id":"976db303-747f-4c80-bb8d-17d02eaadee7","resolution":{"observed_at":"2026-08-11T05:29:51.267504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.855648Z","title":"Mvbench: A comprehensive multi-modal video understanding bench- mark,","venue":null,"work_id":"b964f672-977e-41bc-b4eb-5135dbcb2462","year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.272473Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:c054baaeb3e33cb8d80e677072160b52dced4f7e02ac45d1a4a03e3608a9f369","observation_id":"2cec20e0-c2b2-46ca-926a-2cd54c61a4e0","resolution":{"observed_at":"2026-08-11T05:29:51.860581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T05:29:51.276954Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.276954Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:27227d536fc9c8be68cf9687b867acd70f14f923511245efbd2c49e6739e19ae","observation_id":"34d2f7df-a516-4953-bf2c-2d7e264b4e14","resolution":{"observed_at":"2026-08-11T05:29:51.276954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-18T18:30:18.105306Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-11T05:29:51.282682Z","title":"Internvideo2: Scaling video foundation models for multimodal video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.282682Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:462da3c28ae40f6e0aee59435d11d499b5e9625057a96959fdc0166946ec8fdd","observation_id":"7f5ca850-f005-485f-bcec-d2d08ccae1fd","resolution":{"observed_at":"2026-08-11T05:29:51.282682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.841404Z","title":"Self- chained image-language model for video localization and question answering,","venue":null,"work_id":"a853896e-37e5-435f-ba76-aaf0b316db37","year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.287475Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:d554593461e91b1d87080592bf75d3db6089fb3b3ded648a1a6c78040888f57e","observation_id":"b73ffffa-6723-4754-8183-1b97d3d9654e","resolution":{"observed_at":"2026-08-11T05:29:51.846020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-17T21:35:27.995630Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-11T05:29:51.291907Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.291907Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:45deeacce2cd09c92955b03336ad8ebbc5e56e0dd527a93074a90b4c76bf693b","observation_id":"e782af15-4a88-435d-b6b3-b7598ae1a837","resolution":{"observed_at":"2026-08-11T05:29:51.291907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.826797Z","title":"Videoagent: Long-form video understanding with large language model as agent,","venue":null,"work_id":"47eb4a8a-836c-4123-8059-dc22d01819d8","year":2025},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.296639Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:95a36ef7d08beecf5f3b2b3f5977c842e17c63ce0fbcef038dcf5d7e51a1d71c","observation_id":"92a4f946-5951-4242-9af4-05643838b515","resolution":{"observed_at":"2026-08-11T05:29:51.832421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17235","last_updated":"2024-10-10T05:17:00Z","snapshot_observed_at":"2026-08-16T14:31:04.705062Z","submitted_at":"2023-12-28T18:58:01Z","title":"A Simple LLM Framework for Long-Range Video Question-Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17235","snapshot_observed_at":"2026-08-11T05:29:51.302286Z","title":"A simple llm framework for long-range video question- answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.302286Z"},"links":{"cited_paper":"/paper/2312.17235","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:57e49c2e298d02f40cb88667a26093890dfb9157273cc8199f56cdcf97c7219c","observation_id":"779c2b7a-300b-454d-b289-4758696ef7eb","resolution":{"observed_at":"2026-08-11T05:29:51.302286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14622","last_updated":"2024-12-20T15:06:14Z","snapshot_observed_at":"2026-08-21T02:55:27.584870Z","submitted_at":"2024-03-21T17:59:35Z","title":"Language Repository for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14622","snapshot_observed_at":"2026-08-11T05:29:51.307324Z","title":"Language repository for long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.307324Z"},"links":{"cited_paper":"/paper/2403.14622","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:6de6c984bd71903aad1721ba3f8229f0f41ea520077cd12421e6fae416c1e04c","observation_id":"fb9a8cb9-4666-4f03-af54-b49098b2ee9b","resolution":{"observed_at":"2026-08-11T05:29:51.307324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.812189Z","title":"Question-instructed visual de- scriptions for zero-shot video answering,","venue":null,"work_id":"78f94340-c611-4120-9064-749eabbcc15b","year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.313074Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:d0d2efc9dd29a023b906a55e690ad3af02d17f22121c9c80358655465dbdc1ac","observation_id":"daf1d424-5f21-4a3c-8b3d-d98dfa29eb43","resolution":{"observed_at":"2026-08-11T05:29:51.816975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14848","last_updated":"2024-07-10T17:01:37Z","snapshot_observed_at":"2026-08-19T18:33:09.856329Z","submitted_at":"2024-02-19T16:04:53Z","title":"Same Task, More Tokens: the Impact of Input Length on the Reasoning Performance of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14848","snapshot_observed_at":"2026-08-11T05:29:51.317436Z","title":"Same task, more tokens: the impact of input length on the reasoning performance of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.317436Z"},"links":{"cited_paper":"/paper/2402.14848","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:00a7bd47e9c693fe617255b623c6b4e0f335ae3b9e7cfb1a1178246692a7f40a","observation_id":"84ac54d0-55df-4757-a43e-2305ddb96686","resolution":{"observed_at":"2026-08-11T05:29:51.317436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.797849Z","title":"Large language models can be easily distracted by irrelevant context,","venue":null,"work_id":"6308b757-821c-4239-9a6d-5c1afeadf938","year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.322333Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:417f3885c4fee3a531a41b283f8838fbbf4194afac54cf9d5706ff1e4b813619","observation_id":"6736c950-611b-4dab-ad9e-ced58d2443c2","resolution":{"observed_at":"2026-08-11T05:29:51.802738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.781606Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":"ffad6022-4971-449a-a54c-ad06f9d85965","year":2022},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.326968Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:5d6367d8a56a521d5d86b7333534e453f51c4226c24864562989eb0e68f0b298","observation_id":"db2d6455-f26a-4ea6-bc2a-23a4cd9236ee","resolution":{"observed_at":"2026-08-11T05:29:51.787037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-11T05:29:51.331502Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.331502Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:9176d272be987db809abc640a178bff22be6030378fb55495914ed0fc4a45285","observation_id":"5e862572-2f5e-4d59-b473-7d4514489060","resolution":{"observed_at":"2026-08-11T05:29:51.331502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.766774Z","title":"Ddcot: Duty-distinct chain-of-thought prompting for multimodal rea- soning in language models,","venue":null,"work_id":"67c9402c-4dea-4b6d-8bd8-e459f37aa25f","year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.337272Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:8f943f5b5210843f45e5a255eb6347762470ea372dd40831c8f0b495348d1f30","observation_id":"f1290a7d-a931-433b-a740-3d6bc81295ca","resolution":{"observed_at":"2026-08-11T05:29:51.771872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.752042Z","title":"Enhancing multimodal sentiment analysis via learning from large language model,","venue":null,"work_id":"d1e4a73d-09c1-4ef3-87c2-26cbdaf3ad98","year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.341609Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:00e776c2bd224f01ffd38d8574e7dace6bdd3aa774f7ea1b102f3960590d7ad8","observation_id":"c3947363-3c7c-4dd3-b60e-3dc3edf60c6b","resolution":{"observed_at":"2026-08-11T05:29:51.756953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.737344Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition,","venue":null,"work_id":"ab232691-069a-4c58-9146-72ea52fc9ffb","year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.346135Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:c5817dd1365c461c6e72be1d15b13d64541cc2f26d79ee098f04d1a3bedf0966","observation_id":"bd9a91da-8403-4e3e-90cb-d3d9c73af29a","resolution":{"observed_at":"2026-08-11T05:29:51.742345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13627","last_updated":"2024-07-13T22:10:57Z","snapshot_observed_at":"2026-08-16T14:41:05.754607Z","submitted_at":"2023-11-22T17:44:24Z","title":"Vamos: Versatile Action Models for Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13627","snapshot_observed_at":"2026-08-11T05:29:51.350899Z","title":"Vamos: Versatile action models for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.350899Z"},"links":{"cited_paper":"/paper/2311.13627","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:4e75a6b50283fc2239b5a71aea6ff3991062016c884d75c40651b2681081f5ad","observation_id":"3e5aa05f-549f-4f40-9081-d470ee0498b7","resolution":{"observed_at":"2026-08-11T05:29:51.350899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.721525Z","title":"Large language models are zero-shot reasoners,","venue":null,"work_id":"ffb5c7ed-8d68-4bca-b9c0-d222f6255d77","year":2022},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.356308Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:4ba5451a5bf0dc5ce2ffd9e0f51c0396944080319aa60b5730e777f57ccebb68","observation_id":"81f5fac8-7b5a-489e-bab4-c6a35ee3a06c","resolution":{"observed_at":"2026-08-11T05:29:51.727217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.704004Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":"025e567e-b016-4369-aece-3788ec4439ce","year":2022},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.360643Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:55858942c9904bf655c0452ecbba6eb432be8312d40a3134fc03cd49e8fb951a","observation_id":"7e21f624-5f9d-4657-9b4b-40809b13690e","resolution":{"observed_at":"2026-08-11T05:29:51.710596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.686718Z","title":"Compositional chain-of-thought prompting for large multimodal mod- els,","venue":null,"work_id":"7c33142f-6a81-40af-8d57-b002f65a7a2a","year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.364961Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:29859cfd036be8d68cddf3ac3ee152ececf3592018c232de28edadc286e83080","observation_id":"09818ffb-dafd-4aeb-a383-1fd0d3bc1f0d","resolution":{"observed_at":"2026-08-11T05:29:51.691893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.670345Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions,","venue":null,"work_id":"7da7b159-dcf6-41ee-accf-335138264875","year":2021},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.369044Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:ab2fe762470d8f2ce5a70c73c20753b34373db3c68543c974d8cfb04729239cb","observation_id":"fa23c586-feed-418c-91dd-c826e7f0678e","resolution":{"observed_at":"2026-08-11T05:29:51.676088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.655003Z","title":"Intentqa: Context- aware video intent reasoning,","venue":null,"work_id":"5eef35ed-d6b5-4424-ae03-cdf87c194845","year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.374146Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:c4540568468e9a09142e4e8786809b4e101c7e1657a1447b35e22b2d2d3998ee","observation_id":"ed5e1194-f9b4-4603-a465-a88004e6276a","resolution":{"observed_at":"2026-08-11T05:29:51.660083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-16T21:19:34.047707Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-11T05:29:51.378423Z","title":"Star: A benchmark for situated reasoning in real-world videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.378423Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:6b94c100bcf9a44232e1a8d7e60f59b1f8deb31aecc60499c6947df95fc490a2","observation_id":"1dc03d09-aa3f-4fc7-b7d6-a78b825ce3d0","resolution":{"observed_at":"2026-08-11T05:29:51.378423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.638979Z","title":"Verbs in action: Improving verb understanding in video-language models,","venue":null,"work_id":"f0df215e-2be0-4cb9-ac28-cc00cfdfe2e3","year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.382519Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:66fdfc0564a06bf12c3628e7a9376efb9e94f59cca44fe0cad5f40abb1ce42eb","observation_id":"29a74aa0-e440-4351-acaa-3a00735895d7","resolution":{"observed_at":"2026-08-11T05:29:51.644900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-08-19T18:30:11.337554Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T05:29:51.387257Z","title":"Internvideo: General video foundation models via generative and dis- criminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.387257Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:ebea50fe99dbabd4a73614952d0a7c3f145c0998b5e1ffc0ba469c9e03f9af4e","observation_id":"527a5034-1726-4fac-984e-db07468774e6","resolution":{"observed_at":"2026-08-11T05:29:51.387257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.620084Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":"725d3eb6-6b6f-4fd1-91c3-9c155a10c064","year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.391770Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:533e8d5731dd24214a148497359e95bbe77648372745c2b198e1c047d03046f0","observation_id":"199033f3-a787-4436-aa41-9da7e36fc172","resolution":{"observed_at":"2026-08-11T05:29:51.628488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T05:25:13.305300Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2412.17415."}