{"as_of":"2026-08-11T00:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc42dd71be10270e4af784d68151e573b8904941b8bd6efb224229f868cc887c","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T05:01:06.299758Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T08:41:42.061219Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-11T20:31:13.191851Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"cited_work":{"arxiv_id":"2501.14194","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.14194","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","venue":"cs.CV","work_id":"18b7c23f-d2a1-4fc6-b98f-40f831e6afd9","year":2025},"citing_paper":{"arxiv_id":"2604.23145","last_updated":"2026-04-25T05:07:43Z","snapshot_observed_at":"2026-08-03T01:16:00.979324Z","submitted_at":"2026-04-25T05:07:43Z","title":"UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T08:41:42.061219Z"},"links":{"cited_paper":"/paper/2501.14194","citing_paper":"/paper/2604.23145"},"observation_digest":"sha256:8f3fd2e54a133fc9ce38a20256c7909c723e4ba97e9455a538f242e4a48a60ae","observation_id":"e091819e-610d-4270-a066-990a1831f0e7","resolution":{"observed_at":"2026-05-11T20:31:13.198639Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.14194/citation-record","integrity":"/paper/2501.14194/integrity","json":"/paper/2501.14194/citation-record.json","paper":"/paper/2501.14194"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural module networks","venue":null,"work_id":"6e9ff79d-d176-45b1-bd6d-948f1a02a442","year":2017},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:986960adce153720e290c009d2f2ecbbd55b0719e46e92ebcf230252c3de914d","observation_id":"d07d8b03-e851-4f23-96c4-c44d70652789","resolution":{"observed_at":"2026-05-23T05:05:24.990893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hiervl: Learning hierarchical video-language embeddings","venue":null,"work_id":"0268f0c0-bd7c-4696-8bcb-1fcd1948b557","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:231884b1a81bcac252f818b051e57269052f36b027f6e304ff320f3c9eecb72b","observation_id":"8699864a-d3a2-4c52-a355-91571959b530","resolution":{"observed_at":"2026-05-23T05:05:24.994488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"208b3b06-1644-4c83-8117-629ff3df1ce3","year":2020},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:01ee7dd002f25cf07ff962c8b517449b859ceb69f0c2dce82df927586eb30afb","observation_id":"de589788-3fb3-4e9c-bb5b-9447450f977e","resolution":{"observed_at":"2026-05-23T05:05:24.985455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounded multi- hop videoqa in long-form egocentric videos","venue":null,"work_id":"0868c81b-b149-46be-8d5f-ca68fe12d418","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:68fb9909e04ac66c10b5ed181d1600f04e4e166be1f574d27a9b4e92795747a0","observation_id":"6a054b05-a283-419b-bd53-51d98f322e95","resolution":{"observed_at":"2026-05-23T05:02:37.270670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kitani, and László A","venue":null,"work_id":"3d9db89d-c353-4af6-9673-bdef2fc02526","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:676baeeac3a4395e7e5121873547204e0d6bb919be09cfa231f2d83919bd9698","observation_id":"d32f3b1f-6ffa-46ce-91fd-e4dae113264e","resolution":{"observed_at":"2026-05-23T05:05:24.988331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The llama 3 herd of models","venue":null,"work_id":"0351731f-2700-4a9b-a555-ea0b667bda8a","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:b7d41642de574eb7a5ace6c1a2a9bd54ed29624c0021adb60e854c0f636a516f","observation_id":"6e6bd0ec-03a1-4329-b41a-038edf6a51d9","resolution":{"observed_at":"2026-05-23T05:05:24.979794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoagent: A memory-augmented multi- modal agent for video understanding","venue":null,"work_id":"304c1528-a107-46f5-9c44-fe39cba32589","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:e802fdb10e5901a0dc5a4a15a7ad3028d5a83b3e4c890a7e1246499f9ce02807","observation_id":"15544bb3-8e15-4064-aece-eaee78c0082f","resolution":{"observed_at":"2026-05-23T05:05:24.997794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":"2e28d9ce-e3bb-4399-9879-cbe6c3e58731","year":null},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:c0647454248cfa56b34c8a067c92293b9071e4d4fe9bbcbcac3f7ed8c107a283","observation_id":"ddef7a3a-d5c7-4f5c-b674-2fa461a00acb","resolution":{"observed_at":"2026-05-23T05:02:37.274890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual program- ming: Compositional visual reasoning without training","venue":null,"work_id":"f08a24da-ab89-4763-b214-3b02f7e51159","year":2022},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:d9a3d2bdeb2f6d7e8c320c7bbdcf9ae229bd5e42f8691bb0de3301ab4e57bba2","observation_id":"dc1f27ce-957e-4b37-bedc-182de65930f0","resolution":{"observed_at":"2026-05-23T05:05:24.982429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Free video-llm: Prompt-guided visual perception for efficient training-free video llms","venue":null,"work_id":"28752f60-8d13-4591-96aa-c26eee65d375","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:418a0e3532d2e525a87bdcb52058aecdfde77a9241c26fbbe740297a5ecbbe3f","observation_id":"e990e8d3-d1ea-418f-b7ea-f5a5329c3250","resolution":{"observed_at":"2026-05-23T05:05:24.949958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video recap: Recursive captioning of hour-long videos","venue":null,"work_id":"ea4cb063-a789-49bc-83b1-27bf48812e68","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:467df42093ca166ed97155b20fc65a59094060020d8cda09b612ac20a4a4e1d5","observation_id":"896c9d79-5826-414d-8021-02c1fa92a8e5","resolution":{"observed_at":"2026-05-23T05:05:24.982252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c00ca963-27f4-4110-941f-1eb75c74f8af","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:146478adc48818f97dc2233b5b6f2e2f46cfe6b5bc242f4922943f366e5c155b","observation_id":"cd80d71d-2e03-4afb-b129-522ffd695730","resolution":{"observed_at":"2026-05-23T05:05:24.911485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intentqa: Context-aware video intent reasoning","venue":null,"work_id":"e7e83c95-74ad-483c-ba8c-fa55acdf4273","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:9fad30e9c8473e35556c9c0817e6d717d27fcb38c034431f589196ae661d91e6","observation_id":"90b8005a-a565-4389-80dc-f0838b7a2a14","resolution":{"observed_at":"2026-05-23T05:05:24.946657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intentqa: Context-aware video intent reasoning","venue":null,"work_id":"672520cf-54ef-412c-9b41-95488ab50e49","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:9228e171779a7e2142e6573ef68bcba549251ab15275d8c897556113e2aed84b","observation_id":"3171786e-4afe-40f0-815d-4b0b656c054d","resolution":{"observed_at":"2026-05-23T05:05:24.952755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":"2a405a5a-6cfc-4bbb-b76d-e1a45cd1c5c7","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:b18ae95c0f2a25bb97700e6841d6cacad3e695573f11d461d1ab316a86bfae36","observation_id":"b15977f6-c395-45a1-8392-193ebd2a4982","resolution":{"observed_at":"2026-05-23T05:05:24.936590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"551a0931-6aa1-4002-ac92-4e5141b422f8","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:1fbbcc8db6745edb5993dc74905f790f8659137066578c01315849a1c918ce96","observation_id":"9440fa02-5773-45f2-b853-e3c76e922f59","resolution":{"observed_at":"2026-05-23T05:05:24.956512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end video question answering with frame scoring mechanisms and adaptive sam- pling","venue":null,"work_id":"4a0bb89a-e323-4588-adcc-de8915a84120","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:1aa099ada6c11f72284704a78a6e88f21325ba8040df0f7f569d6a9911581007","observation_id":"58dc5d70-4ba1-4ab3-ae60-dec492c3812e","resolution":{"observed_at":"2026-05-23T05:05:24.959343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VideoIN- STA: Zero-shot long video understanding via informative spatial-temporal reasoning with LLMs","venue":null,"work_id":"5c3e794f-1351-4989-8def-68e60073b33d","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:c23f3ee680171098e5a1f40032e3ebfb60bcd3afe5df65e262cdd05cfa68d8c1","observation_id":"c6ea5862-fb7a-4aef-a489-18ff8209eaef","resolution":{"observed_at":"2026-05-23T05:05:24.937177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vx2text: End-to-end learning of video-based text generation from multimodal in- puts","venue":null,"work_id":"4605e6b4-37ff-44dc-894c-06ec6a9de93c","year":2021},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:6852a86c8d62bba537d80ab1f5a694e19832612e156034cd6a3f04f8b56a7fa1","observation_id":"c5a1ddf9-00b0-4bae-a3aa-e0dfa638d972","resolution":{"observed_at":"2026-05-23T05:05:24.939673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards fast adaptation of pretrained contrastive models for multi-channel video-language retrieval","venue":null,"work_id":"26aad059-618b-449e-b58b-cf24a8867e26","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:0715dab2fc330a630e27b635b167588837004976e240647102f00f9400be9074","observation_id":"a5be5e2c-e8a5-4970-88e5-a648e50a850d","resolution":{"observed_at":"2026-05-23T05:05:24.873754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training-free deep concept injection enables lan- guage models for video question answering","venue":null,"work_id":"4e7f8bdb-ded6-494b-8fd7-1b29b8166aa6","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:9f6d5cb7d23e7377a35d859c7c2d5096fd3dd6598b15ed7d3ff13d4dabf541c0","observation_id":"f7d45b12-2098-4069-a197-646927d4d0bd","resolution":{"observed_at":"2026-05-23T05:05:25.030597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hair: Hierarchical visual-semantic relational reasoning for video question answering","venue":null,"work_id":"31ba1b12-c227-44db-b127-8b866d3425c5","year":2021},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:75e0c4e6b447695a01bf3f5c4982f9476d4c904a55ac9bff4fe16f176c26969b","observation_id":"be98f818-536d-411e-b3a8-5d232fa30cdb","resolution":{"observed_at":"2026-05-23T05:05:24.922613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"11f8e9da-1d99-43d0-8c89-2751b56f73e9","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:7cac4cc254f5ef7047b1cbcadb80910dde1d4f86ed1a99552fde1de041446a75","observation_id":"44b67fe6-a40f-441f-9a58-bcf85655c5dd","resolution":{"observed_at":"2026-05-23T05:05:24.926521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":"bde1f2f6-af1a-412c-9b84-66d0146a9872","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:3eecec9567588dd58fbcc0edd35b10f832843c44e681181235f8fc4d64ec34be","observation_id":"65fa6e4c-3285-4513-b444-d4ea0482cf19","resolution":{"observed_at":"2026-05-23T05:05:24.919876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Morevqa: Exploring modular reasoning models for video question answering","venue":null,"work_id":"dc2a3ed1-e7e7-412b-9c52-fe9aaad8b7ed","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:efcf9932c8e452a4ab3aec6befd4fcf2f690a48620ef38dd9e1b6a3deea74cd1","observation_id":"00c61d5e-95d3-4662-9a73-c563c5fe94b4","resolution":{"observed_at":"2026-05-23T05:05:25.033628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Question-instructed visual descriptions for zero-shot video answering","venue":null,"work_id":"c872aa20-119e-4d42-8d04-6b19d9fc56d3","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:d3fd064416b8d01f660f78c167ab2bfbf51b3251558b32b7dc2e053e805a9011","observation_id":"7f61adff-ff87-4656-99b4-fc396cff212e","resolution":{"observed_at":"2026-05-23T05:05:24.988970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08835","last_updated":"2024-07-03T18:05:02Z","snapshot_observed_at":"2026-08-09T08:22:44.755451Z","submitted_at":"2023-11-15T10:22:35Z","title":"Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding","version":4},"cited_work":{"arxiv_id":"2311.08835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08835","snapshot_observed_at":"2026-07-04T03:29:31.161365Z","title":"Correlation-guided query-dependency calibration in video representation learning for temporal grounding","venue":null,"work_id":"930bf918-21bb-485f-a9a4-7951c1ac3b74","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"cited_paper":"/paper/2311.08835","citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:e10bc44344020d86cc61b2e88edc47a0eedbe82ab6f41855437d1a881e26636d","observation_id":"d4485737-3411-4d71-bbf1-95e07bf34cb8","resolution":{"observed_at":"2026-05-23T05:02:35.938663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4 technical report","venue":null,"work_id":"048f6ec9-d811-41af-b975-0a8753b5053e","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:ba1c33257952133f05b3ed2d83b0d141fdc9942b1d43a57f6b3ac5bef45d6f7b","observation_id":"af6a8a11-0812-44d9-a385-0462a68822e6","resolution":{"observed_at":"2026-05-23T05:05:24.962422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieving-to-answer: Zero-shot video question answering with frozen large lan- guage models","venue":null,"work_id":"b20c4f58-f1f4-4885-84cf-c75191aeae2a","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:e460cdb384ad0abf27283ab3de0ab8c64761f319db6528f70418a4a41bfd6cc2","observation_id":"594ff0a8-6fc3-4906-ad49-cd492f120dad","resolution":{"observed_at":"2026-05-23T05:05:25.012879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dc8afc3f-fa20-48ac-ac0e-2f9303b6c201","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:b5a4dfafd6421284069e7b071411857c1f11e1786e9b8165c417a5f77a5f9a2f","observation_id":"be66a808-9b32-4fbf-9d6e-ec488c361027","resolution":{"observed_at":"2026-05-23T05:05:24.949307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Micap: A unified model for identity- aware movie descriptions","venue":null,"work_id":"4bcdabd7-6424-4ccd-9d6a-4964f4079fb7","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:8b1a81dc2120c149dac15aa7dc47a5d4b59ea4d8161b53087db70a0324aa2dba","observation_id":"07ac8de7-76db-47f6-a70a-6b9171a03db6","resolution":{"observed_at":"2026-05-23T05:05:24.979491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Traveler: A modular multi-lmm agent framework for video question-answering","venue":null,"work_id":"f2117b01-70a7-4725-8f5f-4d57d91bdae8","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:b2517d06129b71162866bcab51ea26f3d118371ab86186fd247e01c8f6d30e95","observation_id":"b9e2e6c4-83a0-4678-9b8e-e55ca3d93f79","resolution":{"observed_at":"2026-05-23T05:05:25.027244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kim, Bilge Soran, Raghuraman Krishnamoorthi, Mohamed Elhoseiny, and Vikas Chandra","venue":null,"work_id":"e4dd8e58-4b0b-4ab4-96c5-42a355399618","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:3bb2ffa8632ab7ff65289fc35173cdd8d2b21cb77c0b7d2b09cf2f96a7b35f23","observation_id":"dbd6406f-eede-4283-87aa-2c0473cbc8fe","resolution":{"observed_at":"2026-05-23T05:05:24.929695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Progprompt: Generating situated robot task plans using large language models","venue":null,"work_id":"a1549f0c-695b-4ca5-9fc7-36f0d05856a6","year":2022},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:170ac3dc72262c61449e25fcaeba2f5cc9fcd021e18cf3f44095b3cb058e107b","observation_id":"a905d258-c2e8-4213-91e6-089eb8141f0e","resolution":{"observed_at":"2026-05-23T05:05:24.992579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"dfea0eef-72c3-4242-8a69-5418e4b59a70","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:52801ed956e063d011b190ce77265cca5d676083f85f723092d5d7f9b988c55e","observation_id":"635f295a-feae-430a-b6c7-081446c85ff8","resolution":{"observed_at":"2026-05-23T05:05:25.009653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modular visual question answering via code generation","venue":null,"work_id":"b41c4cc5-f2c9-469e-8bdc-b8e589d20ca4","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:5daed29ea1ef6e173b19ea0dfbc3ba32a56a7de0b5ece8ec80f57d2aa0e42b8a","observation_id":"dab82b8d-8f7f-4d33-b091-7e7b9e46447d","resolution":{"observed_at":"2026-05-23T05:05:24.870947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"c65b2c6a-9e6a-4aee-a6ea-f99661158e7a","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:614e849bff9c894bc51b611454035b6e4c12bf53aef7988f85252b01bcdd7024","observation_id":"1facce90-297f-455a-a708-7ea961c17ae1","resolution":{"observed_at":"2026-05-23T05:05:24.965623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":"7769bd4f-5d24-4745-8d1b-1b9ded0a5b3f","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:926c4ba2cfbc832bf76c207cab352cc69d4652f1b956516139fc14e58eab64ab","observation_id":"9099eb23-eb5e-4ff5-9e9e-b47ebb119794","resolution":{"observed_at":"2026-05-23T05:05:25.006658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":"65eab0c4-beb8-40d2-8c8e-9b8f5f1a2b0c","year":2022},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:ddb8899ed798ef99b4f8f9e65cebd5f7ef6611470295ef6e8340190d5a026aba","observation_id":"9a661515-dfdb-41d3-9f13-36c6a28d6340","resolution":{"observed_at":"2026-05-23T05:05:25.016989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stair: Spatial-temporal reasoning with auditable intermediate results for video question answering","venue":null,"work_id":"e15108c4-ba84-430c-8a4e-13c201f2e3b6","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:57bafc07ca81fef7b14b99ce2661cf54b521e05f21f177a3c3acda09a88b0c0f","observation_id":"49b4b98c-63ed-4160-b8e6-65a74784b721","resolution":{"observed_at":"2026-05-23T05:05:24.881287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":"f0515890-d05d-418f-a4d8-69d247645431","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:2da3a4d34ea287050f7a6cb70b5e8c6b14c69562f063e7bebb401e1551d6bf0b","observation_id":"8771a3d3-480f-4c70-b78c-9842f3196bb3","resolution":{"observed_at":"2026-05-23T05:05:25.023611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Freeva: Offline mllm as training-free video assistant","venue":null,"work_id":"557cc9ae-5153-4016-8bea-4cb39c4011d7","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:7e98220f72cf6a541d1b074eca9ff1e4f8e8151efc7854494aa018cb14d0e3f0","observation_id":"be423fa0-f946-4500-907f-1795e19430c9","resolution":{"observed_at":"2026-05-23T05:05:24.995907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Next-qa:next phase of question-answering to explaining tem- poral actions","venue":null,"work_id":"73e4408e-777a-4f5d-8a1a-332fe3b20d2e","year":2021},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:01a0acef293c4148b261063334045c1f11adafa3b458a14a9ec3da0ddd8bbccb","observation_id":"b2282c50-4b72-46c9-9da6-e55757e63cff","resolution":{"observed_at":"2026-05-23T05:05:24.976858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Next-qa:next phase of question-answering to explaining tem- poral actions","venue":null,"work_id":"251ffc7f-da98-4a14-bb17-f7ea8d8e906d","year":2021},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:f481cf8e5ffc1d1a906e75fbfc9e9ca6560798e9b2200983d642b6421c2056b8","observation_id":"775fe7ea-d826-41cc-933c-ec4acb7e6195","resolution":{"observed_at":"2026-05-23T05:05:24.955730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Slowfast-llava: A strong training-free baseline for video large language models","venue":null,"work_id":"000d715a-28d0-478e-a5d8-dad0e6673215","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:bff48ae5748d1818016626de50631b105c01a1e85a3dbe33416b0dbf906e844b","observation_id":"660226c7-617c-45c3-a678-7215f34516a9","resolution":{"observed_at":"2026-05-23T05:05:24.969341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Panoptic video scene graph generation","venue":null,"work_id":"4b789961-8543-44db-ba27-cfb963c8a187","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:261315928d0502cc9990cb34d88c0acc3dde6548333afafc7d0fdf72819f9c58","observation_id":"5e76f76e-502a-4372-948e-95ed9fa1725a","resolution":{"observed_at":"2026-05-23T05:05:24.999054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mm-react: Prompting chatgpt for multimodal reasoning and action","venue":null,"work_id":"a7fbf27a-e7be-4f5a-9f25-457fbc4834dd","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:ceb59938c086d252bfdd2c420d08dfac9ff2a08bd6c4d5f3a10ef4d4ffee0ffb","observation_id":"31b81c97-78c9-4879-9f44-5ce2586c6d0d","resolution":{"observed_at":"2026-05-23T05:05:24.959141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ayyubi, Kai-Wei Chang, and Shih-Fu Chang","venue":null,"work_id":"5392da26-6cce-4e42-bab8-04f1fd152f94","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:3c6a547e4f493046cf41fd79b355a15bb68d6c26051f06d2e0ff18e623b2da6b","observation_id":"54c34af3-7868-4e7b-9ba1-0e3e9e8c4dbf","resolution":{"observed_at":"2026-05-23T05:05:25.003171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"0658c4dd-80cb-410c-9ce8-41a6bb682bca","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:e78ea44ea02841e829643b0b6f6e45749315a1e67423c13aee67dd7b137b1e98","observation_id":"9bf4f48a-f555-4c4a-bbe0-fea2236f7e89","resolution":{"observed_at":"2026-05-23T05:05:25.020206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"39747006-a849-4a89-a155-411592b470c0","year":null},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:492c460de4f6336d09f8f3446c47652dc1efdf5bbb2fbfd06f7bfeeb222c30be","observation_id":"c1a98543-ef4a-4ec6-be37-0ba32ee7884c","resolution":{"observed_at":"2026-05-23T05:05:24.975881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple llm framework for long-range video question-answering","venue":null,"work_id":"9aeca149-b2ec-4591-8299-b4e86d16104c","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:f9d6e3d4cc91fc9d7311329695868da467859ea67889284cc4e5cbde0187588b","observation_id":"0566ea3d-888b-49b9-9fe6-484a693fc0b0","resolution":{"observed_at":"2026-05-23T05:05:24.962199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple llm framework for long-range video question-answering","venue":null,"work_id":"cb37f4cd-c85c-42fb-b4bd-8b8785a976f0","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:9cd4929cf72e447e50caf4b45f47abe7874741338eefdd7d84fd0c0cae7fbfd2","observation_id":"50ebef7d-9e3f-4eae-bf1b-6ce8e5466c5d","resolution":{"observed_at":"2026-05-23T05:05:24.968679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":"e1c3e01b-4434-45d7-8402-3f9b93c6ef74","year":2023},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:597cebc1347a9ac59865d04ce9612b5de002c77aacfb237026a787ebe3637434","observation_id":"1dc9fa09-9994-4065-b641-d050ffdbabe1","resolution":{"observed_at":"2026-05-23T05:05:24.985768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Base\" component refers to cases where the generated code operates without triggering addi- tional modules like the","venue":null,"work_id":"c7b713f6-8450-4eca-ad08-43a9f7685a85","year":2024},"citing_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-23T05:01:06.299758Z"},"links":{"citing_paper":"/paper/2501.14194"},"observation_digest":"sha256:c6fb208e5c4b753005e7588e1240e2556df3a6f11c7a77dbb2795b8978d5fe0e","observation_id":"a4353d16-04fb-4e7c-81b0-313e5c1399cf","resolution":{"observed_at":"2026-05-23T05:05:24.972387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":1,"verified_fuzzy":50},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2501.14194."}