{"as_of":"2026-08-19T21:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31c9bbfac67a208e4feafb9d89f465d31820979a9a88770ff7c6ef1523ecdd41","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:03:13.329200Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.09573/citation-record","integrity":"/paper/2502.09573/integrity","json":"/paper/2502.09573/citation-record.json","paper":"/paper/2502.09573"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T21:03:13.196965Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.196965Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:12bd4b8435d2c1259fd74ee3e1ebdb7fa431915a413d3b75a73f034df6b66b58","observation_id":"de2ca75f-24bb-4753-b803-a9624a78f9df","resolution":{"observed_at":"2026-08-07T21:03:13.196965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.203362Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.203362Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:ed907e6925dbff5664ac51ad82404c7bd54ba4aea9bb8fc04381326225030e7c","observation_id":"1624cbe1-9f77-4ade-bdfd-9f68932708a3","resolution":{"observed_at":"2026-08-07T21:03:13.203362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T21:03:13.209644Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.209644Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:8241cecd3091c50bdee30ed901fa03863663f5b7b6405ff2230028fa352939fa","observation_id":"8ddb77f4-17e0-45ba-b278-4f49f0224a65","resolution":{"observed_at":"2026-08-07T21:03:13.209644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-07T21:03:13.216250Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.216250Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:11d7b443c38779ea28f8bf8d85ecfae543109dfad11445cd7e5eb6d318921665","observation_id":"b3f95510-baa5-443b-9ed1-d0c4c216c43a","resolution":{"observed_at":"2026-08-07T21:03:13.216250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03974","last_updated":"2019-11-10T18:26:24Z","snapshot_observed_at":"2026-08-19T15:30:11.123478Z","submitted_at":"2019-11-10T18:26:24Z","title":"A Multimodal CNN-based Tool to Censure Inappropriate Video Scenes","version":1},"cited_work":{"arxiv_id":"1911.03974","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.03974","snapshot_observed_at":"2026-08-07T21:03:17.663493Z","title":"A Multimodal CNN-based Tool to Censure Inappropriate Video Scenes","venue":"cs.MM","work_id":"a2b78c1e-270a-4815-a45b-93e13d1c03d3","year":2019},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.222137Z"},"links":{"cited_paper":"/paper/1911.03974","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:c84dfb1c3d01f1f809cf622538d2339f9d36c245fe371e5fc3dd61e79e019837","observation_id":"67d1ec17-df35-401b-844b-1cc8ae526129","resolution":{"observed_at":"2026-08-07T21:03:17.669138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T21:03:13.228207Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.228207Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:528500bf340fe2cdd6ad2836b30bc46e81283ade93e024fac4be7837a261439a","observation_id":"17e20f24-31b8-4b5c-8da7-44d4284838d7","resolution":{"observed_at":"2026-08-07T21:03:13.228207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T21:03:13.234882Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.234882Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:475dd7aed6424fd08d8628df010714a442166822bd9f7f72370492e7bb14c8f4","observation_id":"db718e0c-6c29-4e3f-9505-7265c13a891c","resolution":{"observed_at":"2026-08-07T21:03:13.234882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.241015Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.241015Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:2afba250346955c8c675b3415e6e388991a6cd103576f38131e1d17a1b77114c","observation_id":"789aac87-32e9-4c96-934a-497f7fa53db5","resolution":{"observed_at":"2026-08-07T21:03:13.241015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.246481Z","title":"H., Zhang, P., Zhang, H., Yang, J., Li, C., Zhong, Y., Wang, L., Yuan, L., Zhang, L., Hwang, J.-N., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.246481Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:665cd067f8544628fc1188d868e0c428cfd22270bc37dccd89b253400f00aaa7","observation_id":"090a0efb-7a03-4b0e-89fe-23ca011b8ccd","resolution":{"observed_at":"2026-08-07T21:03:13.246481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.251781Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.251781Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:d1b40e5d4ebb9a2d4c461f4ecaa1fa8357bd47dccd1e0c6cb389fc6b523561d8","observation_id":"face6fb8-7606-4124-98d4-77ae618e30fa","resolution":{"observed_at":"2026-08-07T21:03:13.251781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T21:03:13.257128Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.257128Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:5f7b1e2a881b8aff425ded593e96035de78302cbc1e0745dcab34994539f7d50","observation_id":"a0bc587c-2b28-4d79-ad1a-0651955a31b0","resolution":{"observed_at":"2026-08-07T21:03:13.257128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:17.865405Z","title":"Openai official api documentation, 2025","venue":null,"work_id":"af6ad5f0-e10c-48a2-9506-27d0ed8d67b0","year":2025},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.263148Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:41a97f316378a03bcbc8bf0893f2119ade34657bd29180700afef294a9bb6b65","observation_id":"c85518da-c75f-43c9-ab7e-5cb99c1ad88f","resolution":{"observed_at":"2026-08-07T21:03:17.873073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:17.823247Z","title":"J., Mahmud, A., Sobuj, M","venue":null,"work_id":"8f5e4dfc-609f-4ce5-96d2-b3c71233bb05","year":2024},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.268323Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:7cd81a4402769e46538ffa9707a639cef681851dc56c6226de2f08156332fc3d","observation_id":"f802c8c8-efde-455f-a883-d7b3fb7cf566","resolution":{"observed_at":"2026-08-07T21:03:17.852117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.273301Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.273301Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:a37119a142b769c9dfd67de0ba76e02b5fd4f3a73cd77f5d0248ce5c4883b762","observation_id":"45ade3e0-9fd1-444f-aeac-847b27b071e8","resolution":{"observed_at":"2026-08-07T21:03:13.273301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:17.793245Z","title":"Will the \\ 1 trillion of generative ai investment pay off?, 2024","venue":null,"work_id":"bdf9eb1f-9c64-4e2c-b5e1-1846313918f1","year":2024},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.278477Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:08db94e70ea4a16fc54c3a1c8587a4d5ad47388138993f176177a1d19b05c538","observation_id":"8c7641b8-503c-4d55-ab5d-42edf16a08e7","resolution":{"observed_at":"2026-08-07T21:03:17.798891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.283982Z","title":"Video understanding with large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.283982Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:85180cd247e942c298d5fd720323541272f21676a4c4cfd52932570aa6d24787","observation_id":"631c7893-09fa-4324-a0d3-12c3c8e99927","resolution":{"observed_at":"2026-08-07T21:03:13.283982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06985","last_updated":"2024-08-30T06:27:58Z","snapshot_observed_at":"2026-08-16T13:35:43.549513Z","submitted_at":"2024-07-09T15:59:28Z","title":"PEER: Expertizing Domain-Specific Tasks with a Multi-Agent Framework and Tuning Methods","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06985","snapshot_observed_at":"2026-08-07T21:03:13.289380Z","title":"Peer: Expertizing domain-specific tasks with a multi-agent framework and tuning methods","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.289380Z"},"links":{"cited_paper":"/paper/2407.06985","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:1b26d51f2129d5a92e197dd513d9619b0399303391e2e10fc0dc531f644197f8","observation_id":"c6fdfcdf-b3b3-4dc0-9a83-71a1ed37e48a","resolution":{"observed_at":"2026-08-07T21:03:13.289380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05461","last_updated":"2017-07-10T00:44:45Z","snapshot_observed_at":"2026-08-18T19:44:22.990581Z","submitted_at":"2017-06-17T00:39:04Z","title":"Truly Multi-modal YouTube-8M Video Classification with Video, Audio, and Text","version":3},"cited_work":{"arxiv_id":"1706.05461","doi":null,"metadata_source":"pith","pith_arxiv_id":"1706.05461","snapshot_observed_at":"2026-08-07T21:03:13.402174Z","title":"Truly Multi-modal YouTube-8M Video Classification with Video, Audio, and Text","venue":"cs.CV","work_id":"413a5862-a12d-4722-a6a7-65e8f0f9766f","year":2017},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.295499Z"},"links":{"cited_paper":"/paper/1706.05461","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:41af8cf6008e1bad6c3a3bd51db890302b8d8ef1fcfba213e663b7315963c5fa","observation_id":"be6885a3-3740-4ae4-bd0e-13f3421c0db6","resolution":{"observed_at":"2026-08-07T21:03:13.409766Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:17.775018Z","title":"and Nawaz, T","venue":null,"work_id":"6c82be5c-14a9-4d74-9d14-0b8919710cee","year":2022},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.300703Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:9db9d6bea646d9098b734228723108c535a85230c01eb57d91a5711822429d8b","observation_id":"ff8f4093-4c2c-4c11-8553-c46bc9b15223","resolution":{"observed_at":"2026-08-07T21:03:17.780330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15061","last_updated":"2024-12-17T12:45:20Z","snapshot_observed_at":"2026-08-16T14:16:02.829397Z","submitted_at":"2024-02-23T02:24:15Z","title":"Fine-tuning Large Language Models for Domain-specific Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15061","snapshot_observed_at":"2026-08-07T21:03:13.306086Z","title":"Fine-tuning large language models for domain-specific machine translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.306086Z"},"links":{"cited_paper":"/paper/2402.15061","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:31da5987c9e4c8f3dbc6fe8d19563c2594bfa395edb13cd547bb45e98eff9cbb","observation_id":"43e1c9d8-a0fa-4e48-878b-a258b5620dc3","resolution":{"observed_at":"2026-08-07T21:03:13.306086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.311663Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.311663Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:3f520e0c8aecb89404a5bf7e6270dd14964a10210cdd64db54cbdb658f104bb3","observation_id":"64a935d5-5239-436a-aaaa-507bab5120fd","resolution":{"observed_at":"2026-08-07T21:03:13.311663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.318053Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.318053Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:b85d890d0b560b3367c5f34aaf39907519026fd16e55347c52f072d11adf6e97","observation_id":"56d84102-f72a-4a7e-b68f-f0a97fef3345","resolution":{"observed_at":"2026-08-07T21:03:13.318053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.323649Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.323649Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:41bea1fdb5abc92ca9ad2ac4089a986a21d3df218fbafbd19ffdc10d08384bd0","observation_id":"955c383f-d17d-4541-a83a-83e4be449b2a","resolution":{"observed_at":"2026-08-07T21:03:13.323649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14150","last_updated":"2025-01-16T10:57:44Z","snapshot_observed_at":"2026-08-19T12:47:50.220214Z","submitted_at":"2023-12-21T18:59:12Z","title":"DriveLM: Driving with Graph Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14150","snapshot_observed_at":"2026-08-07T21:03:13.329200Z","title":"world knowledge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.329200Z"},"links":{"cited_paper":"/paper/2312.14150","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:0c446060580c8836a76c9433c10b1ebfa3f7bb26862b95daba277938b14741d5","observation_id":"2f342397-317a-445a-b690-75ab64be3803","resolution":{"observed_at":"2026-08-07T21:03:13.329200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T18:18:21.309579Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":2,"verified_fuzzy":4},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2502.09573."}