{"as_of":"2026-08-07T09:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:080b6b955e20fdcaadd4a209f2f3fc2046eb6c6cd17964d55b0b6cd6650dfef0","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:47:28.818411Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.17844/citation-record","integrity":"/paper/2507.17844/integrity","json":"/paper/2507.17844/citation-record.json","paper":"/paper/2507.17844"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/app131810399","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.834783Z","title":"Review on wearable technology in sports: Concepts, challenges and opportunities,","venue":null,"work_id":"c546d240-9982-4916-a9f5-74a21813dc74","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.735332Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:526783ee05253bf1b1851cb86d62897e3368c17cf60b0d586ceb92607659a91b","observation_id":"d3859547-cc78-47d7-a1a8-e3fb88d0406d","resolution":{"observed_at":"2026-08-06T14:47:28.838947Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T14:47:28.737949Z","title":"Video -ChatGPT: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.737949Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:4649f1385a1cdc5757cef6d69b0a46c4c38ee36aa69875e83ba84101d94719db","observation_id":"338bca84-3529-4456-bff5-dc53d909da87","resolution":{"observed_at":"2026-08-06T14:47:28.737949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-06T14:47:28.740370Z","title":"LLaMA-VID: An image is worth 2 tokens in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.740370Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:356258d0f6e8e5cbd3e0ad08bfc9b7888772e6b2b85de14a6b2f76b9c7a50312","observation_id":"00d64863-bf51-4eca-aa1e-a18a39129839","resolution":{"observed_at":"2026-08-06T14:47:28.740370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.150432Z","title":"A path towards autonomous machine intelligence,","venue":null,"work_id":"41bf58f0-ce86-4aa0-999e-21ac515e1025","year":2022},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.742825Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:e7b9800289506c8886abcda4fd6cba6af13a170c1a9b645f578803bf123b8d19","observation_id":"74989adb-e10d-4565-aa3a-e6a220763406","resolution":{"observed_at":"2026-08-06T14:47:29.152382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.144283Z","title":"Self-supervised learning from images with a joint- embedding predictive architecture,","venue":null,"work_id":"0329fa94-359f-457a-9f6b-75c64d9533db","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.745119Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:25c48adc19706e83deb9363532b100015c131e58641180c054ddc9b008c747af","observation_id":"41494e1c-70a4-4022-8f07-fb841d1a0c80","resolution":{"observed_at":"2026-08-06T14:47:29.146394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.138320Z","title":"V -JEPA: Latent video prediction for visual representation learning,","venue":null,"work_id":"98c608d2-5d16-4ed1-8e5b-ec42fe0d88d3","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.747272Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:25c48fa0a3f98b490879a6fa4652c7c6d56841b257f5f40357cfbfc5cd0014cb","observation_id":"a7bd5611-59ef-4565-afb7-7d959e6fd077","resolution":{"observed_at":"2026-08-06T14:47:29.140706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04081","last_updated":"2024-10-02T05:00:57Z","snapshot_observed_at":"2026-08-04T07:20:28.702850Z","submitted_at":"2024-09-06T07:44:44Z","title":"UI-JEPA: Towards Active Perception of User Intent through Onscreen User Activity","version":3},"cited_work":{"arxiv_id":"2409.04081","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.04081","snapshot_observed_at":"2026-08-06T14:47:28.938066Z","title":"UI-JEPA: Towards Active Perception of User Intent through Onscreen User Activity","venue":"cs.CL","work_id":"cd2ed764-0ded-4b0a-98fc-3536c4df43f2","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.749711Z"},"links":{"cited_paper":"/paper/2409.04081","citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:cf309b3634f532004c6e1081165f4840e477ed01f4c3773c2826ca96e9e91e68","observation_id":"643eb1ac-91a6-4c1e-bbc1-b16805fde231","resolution":{"observed_at":"2026-08-06T14:47:28.940562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-06T14:47:28.752004Z","title":"V -jepa 2: Selfsupervised video models enable understanding, prediction and planning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.752004Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:dfed6468eef24d5bf007cd754753f2d3fc977c9f60b0e8a8166bddfe30fa1e9d","observation_id":"029376f8-78cd-460f-9024-e915cb0e2d86","resolution":{"observed_at":"2026-08-06T14:47:28.752004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.132897Z","title":"Computer vision for sports: Current applications and research topics,","venue":null,"work_id":"cc5000c4-c7d9-4811-844b-771dcd3796b8","year":2017},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.754962Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:565650d77a7829cefcc6240c7b3ce82a297e1340229ad1efd28433e87b1f3055","observation_id":"354d65ae-8848-46b7-af8c-44abcdf96f4f","resolution":{"observed_at":"2026-08-06T14:47:29.134924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.127128Z","title":"Soccernet-v2: A dataset and benchmarks for holistic understanding of broadcast soccer videos,","venue":null,"work_id":"d237c831-bc77-46a3-9b78-57ece3cbf63b","year":2021},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.757216Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:1a1e13e2d438dc2011176f55a21ab4e94e3cc544f8bb7e289a9b51c6fb3fa377","observation_id":"dc57ca70-1e9c-48d0-8886-435839cb8a2a","resolution":{"observed_at":"2026-08-06T14:47:29.129217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.121650Z","title":"Soccernet: A scalable dataset for action spotting in soccer videos,","venue":null,"work_id":"683ca72e-7ce6-423b-b072-d66c81d88d06","year":2018},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.759138Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:77e1c80d7a25d1488fbf8c51c5a65dba4e1c189624aeaae1428363c2d3f728d0","observation_id":"79293dc3-e8d5-4646-81d1-c6af34e48e68","resolution":{"observed_at":"2026-08-06T14:47:29.123627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.115801Z","title":"Fine-grained action recognition on a novel basketball dataset,","venue":null,"work_id":"572f47b0-19df-4e69-9405-815caa1faa1b","year":2020},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.761422Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:d0cebdac07f895b51e5fb104d3f157935f17e6878eae03e6b5364c56bf42942a","observation_id":"fac1c96e-771e-4fe3-bb4b-d68df025fad1","resolution":{"observed_at":"2026-08-06T14:47:29.118061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.109984Z","title":"Soccernet caption: Dense video captioning for soccer broadcasts commentaries,","venue":null,"work_id":"6f7dafb5-3022-49cd-b8d4-cf80b7b9a85d","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.763299Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:13dcac47209d46d2787ca582850a4119e51eb2197124a740186b18f3c9fdd3a6","observation_id":"8fd68349-1c4d-498b-8c8e-be5fefeb4b81","resolution":{"observed_at":"2026-08-06T14:47:29.112178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.104243Z","title":"Sports video captioning via attentive motion representation and group relationship modeling,","venue":null,"work_id":"f8915a00-0a13-4efd-af73-ac9e6846a1e2","year":2019},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.765170Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:489bb2d697822acba2628a1f57e0750f3712b3d9d92c1dc46dffaca3a5c9ddda","observation_id":"f03400f5-4020-4fe7-bf01-b888895bf08e","resolution":{"observed_at":"2026-08-06T14:47:29.106353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.098758Z","title":"Matchtime: Towards automatic soccer game commentary generation,","venue":null,"work_id":"761595da-ca49-4bc6-9297-bf4c64aab5fb","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.767048Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:c38412bcb6e73112d9d748ce304f9bbb64c17d7366b37cf389e1ab8b028a3770","observation_id":"c99070ce-cc63-4f03-b9a5-68d95982b5fe","resolution":{"observed_at":"2026-08-06T14:47:29.100713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13888","last_updated":"2024-02-28T02:26:03Z","snapshot_observed_at":"2026-08-03T02:30:07.559069Z","submitted_at":"2024-01-25T02:08:37Z","title":"Knowledge Guided Entity-aware Video Captioning and A Basketball Benchmark","version":2},"cited_work":{"arxiv_id":"2401.13888","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.13888","snapshot_observed_at":"2026-08-06T14:47:28.922992Z","title":"Knowledge Guided Entity-aware Video Captioning and A Basketball Benchmark","venue":"cs.CV","work_id":"920715cb-aee8-410d-a710-50e194ecc528","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.768978Z"},"links":{"cited_paper":"/paper/2401.13888","citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:50331339f30e174d937f5ce607ac1753143b9abe974b9bd56844e5b86ddb62ef","observation_id":"1709e277-9f4e-4a28-9110-8115693abf3d","resolution":{"observed_at":"2026-08-06T14:47:28.925700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.093300Z","title":"Fine-grained video captioning for sports narrative,","venue":null,"work_id":"bcaa96e7-20a1-4914-a1f2-ca6f5dc78a69","year":2018},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.771064Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:239f057de6b237c8bac24e5f20fe19885524b0239250bd51332e84318904e5c1","observation_id":"7c6771fa-87fd-482a-9d0d-3a0ade95999c","resolution":{"observed_at":"2026-08-06T14:47:29.095279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.087422Z","title":"Finegym: A hierarchical video dataset for fine -grained action understanding,","venue":null,"work_id":"fb661a44-efa6-4017-bbef-ecb6f7541dce","year":2020},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.772938Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:5b38ef1dda9d7036c93b41f188e3443b601b9a188f5bd0445ca1d7348f127dd1","observation_id":"21d0f4e1-c2ea-4a6d-8575-36f75976bcd0","resolution":{"observed_at":"2026-08-06T14:47:29.089788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.081705Z","title":"Finediving: A fine - grained dataset for procedure-aware action quality assessment,","venue":null,"work_id":"b9417aa0-07b5-481a-9f53-726410d9d2aa","year":2022},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.775051Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:d295d46f039ac5df135be5c02a9444ccb0f15d8252088d971a2f2fba07d5261c","observation_id":"35700ec6-dfc7-473b-8984-aab3d5f17bf9","resolution":{"observed_at":"2026-08-06T14:47:29.083763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.075722Z","title":"Tacticai: An AI assistant for football tactics,","venue":null,"work_id":"e9ba2f8f-e9e8-4f8e-8c79-fee0714f8f67","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.776961Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:adca5e66a6097fdea5f8cbd5eb0d2f6896637b5bd579306fdd6fad7c857bf1b1","observation_id":"3d7bb799-2d82-4796-b9fd-f7259c4d6e1c","resolution":{"observed_at":"2026-08-06T14:47:29.077698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.069380Z","title":"VARS: Video assistant referee system for automated soccer decision making from multiple views,","venue":null,"work_id":"96d16c52-fe56-4a89-93b5-efae7f44c37a","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.778846Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:5e65677955f6c4c0a7c717a696e040413d2107118285acadf0cdbde7acf8f2f6","observation_id":"96745f7f-0097-49c8-af54-2e418a36fc36","resolution":{"observed_at":"2026-08-06T14:47:29.071515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.063959Z","title":"X -VARS: Introducing explainability in football refereeing with multimodal large language models,","venue":null,"work_id":"b120eba4-4ee1-405d-a59a-e73e62cf4fab","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.780649Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:54a95e6fb7f279caa5ef53115894cf86f530425a4364a79410a67275c4204f73","observation_id":"18204d28-eecd-429a-89a7-660da1fa7d85","resolution":{"observed_at":"2026-08-06T14:47:29.065929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.782472Z","title":"Sports-QA: A large -scale video question answering benchmark for complex and professional sports,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.782472Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:9c1003bb6d55dd72c18dd41923145466828e99a5ae2c5ac886078c1d05c07add","observation_id":"19ac599a-1c98-46cc-b946-2036d5ea9ff0","resolution":{"observed_at":"2026-08-06T14:47:28.782472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.058442Z","title":"SportQA: A benchmark for sports understanding in large language models,","venue":null,"work_id":"001549e3-0fd4-4c0c-b4aa-83986436f449","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.784339Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:ece1a353d42485f275a0701f1ad143db9d4ca39532cc36a3810db9cc32f05613","observation_id":"1e851dbc-fdf2-424a-a7fb-05e4c106ecd6","resolution":{"observed_at":"2026-08-06T14:47:29.060399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08474","last_updated":"2025-03-14T19:32:04Z","snapshot_observed_at":"2026-08-07T04:00:22.894117Z","submitted_at":"2024-10-11T02:58:38Z","title":"SPORTU: A Comprehensive Sports Understanding Benchmark for Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08474","snapshot_observed_at":"2026-08-06T14:47:28.786186Z","title":"SportU: A comprehensive sports understanding benchmark for multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.786186Z"},"links":{"cited_paper":"/paper/2410.08474","citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:bab2255f52d58a06c3b4d025e57699f452db3acd3ef28a9ca22556f75aeaf7a6","observation_id":"5c80b69f-ef7f-4e47-a145-9fe7c26de692","resolution":{"observed_at":"2026-08-06T14:47:28.786186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.052703Z","title":"Flamingo: a visual language model for few -shot learning,","venue":null,"work_id":"66b2b4c3-b1d0-4aab-a39d-fbf855a771b1","year":2022},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.788390Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:09b0479dc221c12461940378196e783466fd2380703477f8c2877743d00433e1","observation_id":"05827de8-aa86-48d4-b09d-4a6f57139e35","resolution":{"observed_at":"2026-08-06T14:47:29.054842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.047071Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"0fced7fa-b0af-4eab-b1b9-2848bbbf1949","year":2022},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.790361Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:84ac77ec86d8c32199fe627e421b132deeb239c19210b5edc83c9043b06e895c","observation_id":"6326f665-380b-4582-b3d0-ee35e9d3a584","resolution":{"observed_at":"2026-08-06T14:47:29.049117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.041346Z","title":"BLIP -2: Bootstrapping language- image pre -training with frozen image encoders and large language models,","venue":null,"work_id":"0278043f-e2c9-4446-930b-7c517ad8c614","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.792353Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:f66b42d8dec3b568dcb156c81315247efca389b698df65239458245b6fa7b105","observation_id":"27132ff3-fe73-447b-85dc-23a36b03cca7","resolution":{"observed_at":"2026-08-06T14:47:29.043418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.035525Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"91625e70-b659-4c21-9fc6-97922c51ea96","year":2021},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.794410Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:6c46d6da41591528f3d6c243aa82c7ffd735aef4aaf01c8267190d3003ef6877","observation_id":"1e314612-64b6-4c4f-bfae-a239a2f1a818","resolution":{"observed_at":"2026-08-06T14:47:29.037574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.029726Z","title":"Sigmoid loss for language image pre -training,","venue":null,"work_id":"1b3ada7c-f25e-468c-b0ec-1bb0ee4a3b88","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.796296Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:f2596741ebd5eb84f91e5fe76cde31306e564ec1b1d80afa46923b1f530dd62f","observation_id":"c3e888dd-8ada-490a-b844-0a4a727806c1","resolution":{"observed_at":"2026-08-06T14:47:29.031708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.024020Z","title":"MVBench: A comprehensive multi-modal video understanding benchmark,","venue":null,"work_id":"92b8c862-b5db-43de-b0fc-6bf858d8ec86","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.798156Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:86231f229f52a8a5f76aed2667b9274781e99d3c3d5273b6f717ae2a956a6ab3","observation_id":"8cd9abe6-d824-4158-9990-45f7127f4079","resolution":{"observed_at":"2026-08-06T14:47:29.026208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.018192Z","title":"Llama -vid: An image is worth 2 tokens in large language models,","venue":null,"work_id":"5b563a7b-96b8-4519-8fd4-05a662ee2c3d","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.799820Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:71dfd334e3f11b2bb62bf9a275d2e160847c887975ed4b70bce2511bda54c4ac","observation_id":"09140373-a5f7-4ad0-adf8-01dfc9870cf4","resolution":{"observed_at":"2026-08-06T14:47:29.020360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.012317Z","title":"Video-llama: An instruction-tuned audio- visual language model for video understanding,","venue":null,"work_id":"5be5988c-b934-4d41-a2c8-74cb2f75f668","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.801681Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:9f6f8288910e0f11d7168d2e1df1ccfd890522136d3af6cd8f374294843c9019","observation_id":"8613031e-91c7-49b0-9caf-e3f67a6c1907","resolution":{"observed_at":"2026-08-06T14:47:29.014390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.006482Z","title":"Temporal alignment networks for long-term video,","venue":null,"work_id":"04b4842e-2656-410a-9863-ccac9ca573ed","year":2022},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.803498Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:3ba656ab103d5f128632615c3acdfedcb378205b3e316afe944807542cfa0b87","observation_id":"b5588f34-ed5d-4267-aedc-2f891d43403c","resolution":{"observed_at":"2026-08-06T14:47:29.008523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.000219Z","title":"Multi-sentence grounding for long -term instructional video,","venue":null,"work_id":"3930deb5-b616-4bff-b007-0be67900f93b","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.805361Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:dc9b4f79b9e09ed020833bdab56dcc050074eb5f1e839a37029408faf023f1ba","observation_id":"94b8b072-21f6-433a-b120-af04d79c59e9","resolution":{"observed_at":"2026-08-06T14:47:29.002751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.994324Z","title":"Panda- 70M: Captioning 70M videos with multiple cross -modality teachers,","venue":null,"work_id":"e6f0b1ea-e498-4225-aec0-32292580d303","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.807354Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:fe98303b82fc90e6e05089ca5ac861e88664565d319af6630c6dd3a7e3da4546","observation_id":"b3295252-d1f3-4c72-8202-08f2a77f17de","resolution":{"observed_at":"2026-08-06T14:47:28.996492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.988071Z","title":"Vid2seq: Large -scale pretraining of a visual language model for dense video captioning,","venue":null,"work_id":"b6f8e313-1759-40aa-8bdd-e259341e5d40","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.809252Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:e6090d0eea27128927f66247c6e31c7f90c9f0da568c20db5333616326a1fb7c","observation_id":"a1e043d5-b327-4f58-97d0-c7c0245eea61","resolution":{"observed_at":"2026-08-06T14:47:28.990368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.981963Z","title":"Streaming dense video captioning,","venue":null,"work_id":"e938a7e1-305f-4709-a5bf-7a09992b7b25","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.811016Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:025ac586f8ef95dfef785580c363ed5d89cc787f5f8aa3cab883755ad92a805b","observation_id":"542eae72-54e7-47eb-a817-15cb45c4713e","resolution":{"observed_at":"2026-08-06T14:47:28.984046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.975869Z","title":"Autoad: Movie description in context,","venue":null,"work_id":"51feca92-7361-44ad-aac1-4fe35600c180","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.812820Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:2411d9fd443c1044958a4e0a26ee57afa23a8bdf057a1822f5839874e32183b0","observation_id":"8c1bb864-2069-46bd-ad3c-82db58b13626","resolution":{"observed_at":"2026-08-06T14:47:28.978020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.969784Z","title":"Autoad II: The sequel —who, when, and what in movie audio description,","venue":null,"work_id":"45864313-1bc3-4b62-b536-b0ea36b2255c","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.814682Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:c50e04b3ada76a728cf33af33a48343e768a329b371710fc427239c9d6aaa05b","observation_id":"2287eebb-0f85-4024-bd33-826f84e35ab4","resolution":{"observed_at":"2026-08-06T14:47:28.971953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.963377Z","title":"Autoad III: The prequel —back to the pixels,","venue":null,"work_id":"a004e318-1100-4d6d-9876-bbc67ff643e0","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.816566Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:5710cd454c813e5e4fc07b96bbfaf02cf6129fe75182af891049f2b93eeaebb3","observation_id":"b3b75a8e-7dfc-4aaa-9db7-271e0fde46ba","resolution":{"observed_at":"2026-08-06T14:47:28.965659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.955951Z","title":"NSVA Subset: Basketball Video -Text Dataset,","venue":null,"work_id":"6ae3fd56-4da3-4e25-8ca9-ff80b52ea760","year":2025},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.818411Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:c58357db72dc017ab1da6e6d125cc41d10fe31a06f72642af4339c9fd099e949","observation_id":"225b382c-0702-4d58-aeff-48fbc85917e1","resolution":{"observed_at":"2026-08-06T14:47:28.959004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":3,"verified_fuzzy":34},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2507.17844."}