{"as_of":"2026-08-13T14:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d4a78e3407d8f9501840e00f6789ffa6fb7ab4220a2e8f8b95b5018450876e37","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:30:34.249618Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:30:31.083510Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:30:34.809388Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"cited_work":{"arxiv_id":"2505.24371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24371","snapshot_observed_at":"2026-08-07T12:30:34.809388Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","venue":"cs.CV","work_id":"d3b23750-4178-4a97-af9a-c5e6591f7f4c","year":2025},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.083510Z"},"links":{"cited_paper":"/paper/2505.24371","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:b3e6c020c584bc7014de560a8e51f640b1c42f2f88efcc69d50889b8b98793bb","observation_id":"c65a519e-1029-4de4-bda0-8b02e1b64b5a","resolution":{"observed_at":"2026-08-07T12:30:34.865426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24371/citation-record","integrity":"/paper/2505.24371/integrity","json":"/paper/2505.24371/citation-record.json","paper":"/paper/2505.24371"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"cited_work":{"arxiv_id":"2505.24371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24371","snapshot_observed_at":"2026-08-07T12:30:34.809388Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","venue":"cs.CV","work_id":"d3b23750-4178-4a97-af9a-c5e6591f7f4c","year":2025},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.083510Z"},"links":{"cited_paper":"/paper/2505.24371","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:b3e6c020c584bc7014de560a8e51f640b1c42f2f88efcc69d50889b8b98793bb","observation_id":"c65a519e-1029-4de4-bda0-8b02e1b64b5a","resolution":{"observed_at":"2026-08-07T12:30:34.865426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:38.342614Z","title":"Further research [5] extends the image VLM to support multi-frame and video data modalities","venue":null,"work_id":"2010edb7-32e8-4984-984b-47030886632c","year":null},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.146651Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:5f339ba889a02c93c298e39254e08a6727faec31675272c883b99d58dfd3d255","observation_id":"352a4101-0848-419e-83ce-c1e6b08b7fb8","resolution":{"observed_at":"2026-08-07T12:30:38.424721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:38.231147Z","title":"The first phase is the tran- scription generation phase","venue":null,"work_id":"8fd16214-6667-4e84-aad8-a285c4652a50","year":null},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.239277Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:42dc386169368720a2ec24bcb14cc0643bff2ae338525f2e03eb1648d5a0e690","observation_id":"d97db90e-1f28-4999-8b0c-b3b39bbfd3d3","resolution":{"observed_at":"2026-08-07T12:30:38.266635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:38.112273Z","title":"Baseline models We leveraged the LLaV A-1.6-7B VLM [23] to generate local and global transcriptions and the Llama-3.1-8B LLM [24] for the VideoQA task","venue":null,"work_id":"5864a769-dd87-4168-afc5-4ef76ff9cd78","year":null},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.336355Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:0becb40a3109899823538f8bc46a8ffb5dfddffa7084fe97772f7c81210af2be","observation_id":"74f755b7-84d5-41e9-a367-80dcf7a6f2de","resolution":{"observed_at":"2026-08-07T12:30:38.179602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:37.974737Z","title":"The system is inherently modular and built on open-source VLM and LLM","venue":null,"work_id":"06937cd8-e461-4c66-aa42-888fda7da8e2","year":null},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.423370Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:f74f2581f656dcfa030ac9df97b60e35d3cad9cf420ca1cca37a114934984a33","observation_id":"797c5fb9-80c5-4173-a6bf-a4b17cc92020","resolution":{"observed_at":"2026-08-07T12:30:38.058928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:37.766597Z","title":"MOKA: Open- vocabulary robotic manipulation through mark-based visual prompting,","venue":null,"work_id":"9717f556-4884-42e1-8f37-c0cc3f5ba6c3","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.499625Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:93d1eddc420cdc85bb7c2549207dd8d6cab8a33621ee5570bbcf31a73774689e","observation_id":"53e15e52-b447-4329-b1ab-f728b312f753","resolution":{"observed_at":"2026-08-07T12:30:37.875398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:37.597565Z","title":"VLAAD: Vision and language assistant for au- tonomous driving,","venue":null,"work_id":"bb57e8ca-4aaf-41dd-a39e-9e5c2722363b","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.568370Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:855964066ae8303b8d24d92360440df9c47df447571b998ff5e093696317b821","observation_id":"382d85ff-e26b-49d7-9343-02f316d43980","resolution":{"observed_at":"2026-08-07T12:30:37.669183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:37.418577Z","title":"Smart customer service in unmanned retail store enhanced by large language model,","venue":null,"work_id":"0e0b1aff-90aa-4668-b6da-c50a46b8cf93","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.641448Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:ade7dc368f0dd8d0dbf0c28d4b3b3005763e035688f39207e86f3111252fa0cd","observation_id":"59c1cdc9-db3a-4ac2-9831-49adbccd3cbe","resolution":{"observed_at":"2026-08-07T12:30:37.490277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T12:30:31.714734Z","title":"Qwen2-VL: Enhancing vision- language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.714734Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:b20800cd9462d9ec44046ae80359642717cb11b4744367c2b6099eb7683dbebc","observation_id":"c0d8171a-5c54-4539-9534-0024ca4953cf","resolution":{"observed_at":"2026-08-07T12:30:31.714734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:37.238600Z","title":"LLaV A-OneVision: Easy visual task transfer,","venue":null,"work_id":"4d79a1bd-eccf-47a4-bc04-deec321624dc","year":2025},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.782618Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:322bd3d2f96e95ecfde7345088d3d53532bfa7f471650996ea5094097937ca18","observation_id":"0b8ea0af-1122-47fb-9588-f63d5c0fe1f3","resolution":{"observed_at":"2026-08-07T12:30:37.325359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T12:30:31.859767Z","title":"VideoChat: Chat-centric video under- standing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.859767Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:19acf44c31c83c7d2f2616eda397dec9aae8b25676e02349cec3a541d4ac8c26","observation_id":"ac08881b-48a1-4659-a175-f4a53b64c0d8","resolution":{"observed_at":"2026-08-07T12:30:31.859767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:37.105480Z","title":"A simple LLM framework for long- range video question-answering,","venue":null,"work_id":"998a6db2-f232-4961-9194-23e694691439","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.933492Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:baa748e24c4418168bd3868b6956c307c8304ea29e36c0cc3187e93e1ef5d2c0","observation_id":"31d3d6c0-03e8-4cb2-803f-7631c67d5c9d","resolution":{"observed_at":"2026-08-07T12:30:37.158371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:30:32.012193Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.012193Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:43d2bb9e8c6d1ee075295015b12ca00e69f274bddc52beff85976165645c11f0","observation_id":"0c71c004-3791-4536-a46f-72046256c69e","resolution":{"observed_at":"2026-08-07T12:30:32.012193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:30:32.096412Z","title":"Gem- ini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.096412Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:815627e7d6d9f2f92af9bf50b6993272eb1fc401a6eeab7c00a7c7ed0cdc15b1","observation_id":"cbe3c9c6-fc2b-408d-bb41-042cbc11112f","resolution":{"observed_at":"2026-08-07T12:30:32.096412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:32.202556Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.202556Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:2609c862e499eb4e026983a9cff8539e6292f2469a940d027cf572b7ac8fb540","observation_id":"5d6d3dc4-2dc4-41f1-ac3d-f8b7950efd09","resolution":{"observed_at":"2026-08-07T12:30:32.202556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:36.855197Z","title":"An image grid can be worth a video: Zero-shot video question answering using a vlm,","venue":null,"work_id":"edd7587e-6922-49a9-b208-4572bc9c291b","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.275288Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:809018587a8eb6ee362526c7c4822a9f28970681d9afd048e4f9f679a36d5a96","observation_id":"c49c3092-be31-4fe1-936b-8c2c65624229","resolution":{"observed_at":"2026-08-07T12:30:36.936620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:36.697596Z","title":"Self-chained image- language model for video localization and question answer- ing,","venue":null,"work_id":"e9190a6c-b1f9-4e84-95e5-16ded028b644","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.380318Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:2cb23721e02a04e1fc801f782d24fbdf5f1a7f19bf46650822746dcfcffbb315","observation_id":"c0414aa9-916d-4f00-9240-84c5999a2165","resolution":{"observed_at":"2026-08-07T12:30:36.788952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-07T12:30:32.456684Z","title":"Set-of- mark prompting unleashes extraordinary visual grounding in gpt-4v,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.456684Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:2df18cbb9ad52fa72feaa42d7df184e41937d24876efea9d8325b02ae36fea48","observation_id":"3768e06e-5716-4740-8abc-34f9f9b9459e","resolution":{"observed_at":"2026-08-07T12:30:32.456684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:36.525521Z","title":"GeoChat: Grounded large vision-language model for remote sensing,","venue":null,"work_id":"8f83bac2-36ca-46db-bc87-fbb097d6793d","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.558947Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:6be8dbe23fc9d41e12ceaa6589c32bdcc17ba13b2eb22c885a1c6bc28d7730ce","observation_id":"b2e5dfae-a11a-49e4-bcbc-1eedfffda2b2","resolution":{"observed_at":"2026-08-07T12:30:36.594439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13596","last_updated":"2024-11-29T10:18:58Z","snapshot_observed_at":"2026-08-12T23:19:22.625658Z","submitted_at":"2024-07-18T15:35:00Z","title":"EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13596","snapshot_observed_at":"2026-08-07T12:30:32.685636Z","title":"Earth- Marker: A visual prompt learning framework for region-level and point-level remote sensing imagery comprehension,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.685636Z"},"links":{"cited_paper":"/paper/2407.13596","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:3d5873b335e095cbd79a4b352dd2e8e7df9d050ce09a107f94ecac3052d50ca4","observation_id":"21b7a483-93aa-4aa1-8821-9ec4b97b7df8","resolution":{"observed_at":"2026-08-07T12:30:32.685636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:36.282279Z","title":"PIVOT: iterative visual prompting elicits actionable knowl- edge for vlms,","venue":null,"work_id":"64073b7b-fa19-43af-9bff-dac2ac482275","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.807866Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:a6fafe12c5a0e8f90f199fb89c32394ee7a68186a29fe59608068fcfd66d937c","observation_id":"609b1966-0f06-4ac3-8f54-bb72cfdb3bb7","resolution":{"observed_at":"2026-08-07T12:30:36.385702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17422","last_updated":"2025-04-07T10:55:13Z","snapshot_observed_at":"2026-08-12T22:54:13.424754Z","submitted_at":"2024-08-30T17:12:14Z","title":"Open-Vocabulary Action Localization with Iterative Visual Prompting","version":5},"cited_work":{"arxiv_id":"2408.17422","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.17422","snapshot_observed_at":"2026-08-07T12:30:34.517356Z","title":"Open-Vocabulary Action Localization with Iterative Visual Prompting","venue":"cs.CV","work_id":"8445e23f-09f3-4155-b6e5-51f3511c393d","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.904432Z"},"links":{"cited_paper":"/paper/2408.17422","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:cfa265ebd1b4d51bb12d6dd79ab076244a57bf6e7bf439d3a581f1baafc049bd","observation_id":"4190cbcb-4f1e-4621-a6e7-d0333ec88c03","resolution":{"observed_at":"2026-08-07T12:30:34.604723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:36.082332Z","title":"Video graph trans- former for video question answering,","venue":null,"work_id":"8d3ef1ea-37f5-4719-94aa-50d1cd6473e7","year":2022},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:33.038946Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:81e910391435880ade26aaf235b61f6f80f15c7b25b1d43ed89ed9a2af5d95b0","observation_id":"2579bd6f-136b-45e3-97c8-57fd2d7e1a2c","resolution":{"observed_at":"2026-08-07T12:30:36.199823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T12:30:33.191576Z","title":"InternVideo: General video foundation models via generative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:33.191576Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:46d9878fc2c69a321d16a55d0300375470a57a07922c071ac3a39042d2b7c1f3","observation_id":"a19f1bcc-2c7e-4e11-9527-3b1c0426aa55","resolution":{"observed_at":"2026-08-07T12:30:33.191576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:35.872598Z","title":"MVBench: A comprehensive multi- modal video understanding benchmark,","venue":null,"work_id":"f5b0415c-f150-4843-9093-7ec448e3c33f","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:33.328725Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:fbc35686a25e0b2fcb67150b6fd6caec0a53511948c9a16600a42cc4ad894240","observation_id":"5a61dbaa-5afa-4bdb-af4a-d952a8e3dd2f","resolution":{"observed_at":"2026-08-07T12:30:35.967511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:35.656313Z","title":"VISTA- LLAMA: Reducing hallucination in video language models via equal distance to visual tokens,","venue":null,"work_id":"3f0c9b82-0aae-43a5-9fd0-b6e95463a840","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:33.421014Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:854edb3dfd29d64ef8786114812650ad43da4b90412707aaf282c7b061a69533","observation_id":"e5458f8c-7aa0-41de-b65b-35e2535e1d72","resolution":{"observed_at":"2026-08-07T12:30:35.767758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:35.447292Z","title":"CogAgent: A visual lan- guage model for gui agents,","venue":null,"work_id":"055e43d7-324a-4d08-89b6-f589a7e899ac","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:33.562294Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:ff9ec7803bc516a8e8bab26adf3f246355193f21d4521f59597d9ff36371e29d","observation_id":"3c87cb0a-7f1d-46f9-a926-58e4b0f43823","resolution":{"observed_at":"2026-08-07T12:30:35.515474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:35.281456Z","title":"LLaV A-NeXT: Improved reasoning, OCR, and world knowledge,","venue":null,"work_id":"76054eaa-16cb-4222-9086-aa3fefdb2ff6","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:33.653791Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:5090a32278620e007552e42bc17e711638133db3842bda3fe093bd0a2a54b22d","observation_id":"a087d91c-8ca7-4179-9248-8d249309ce08","resolution":{"observed_at":"2026-08-07T12:30:35.344142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:30:33.760176Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:33.760176Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:fe2f401b82bfcf588b1da94e4fc61bffc1c2f8afa9e31d58f5c4c5d6c9e4f1c9","observation_id":"3bda2006-30c5-4bb7-a8ee-daf3b6c3f689","resolution":{"observed_at":"2026-08-07T12:30:33.760176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:35.152719Z","title":"NExT-QA: Next phase of question-answering to explaining temporal actions,","venue":null,"work_id":"4532625e-b9c1-496b-8ef2-2fd48d01aa8f","year":2021},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:34.055988Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:96c3f5f601e44da9fc4f8e9f7fcb3c9651237b5e3a8174c64222e76157f18ff4","observation_id":"16576960-2833-4818-a5b1-2a2608474e3c","resolution":{"observed_at":"2026-08-07T12:30:35.229409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:34.984261Z","title":"STAR: A benchmark for situated reasoning in real-world videos,","venue":null,"work_id":"f3e63c91-16de-40be-9598-97a036a5f0cf","year":2021},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:34.249618Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:50994cc203c73aaf5308708b6c1a9e384751c2dc8cefb424877ac1d574eb8703","observation_id":"22ba6029-c29b-4815-abb5-4aeecc966736","resolution":{"observed_at":"2026-08-07T12:30:35.085113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":20},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2505.24371."}