{"as_of":"2026-08-15T03:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:132f44d297b7e2d8f087a84501d844773e58f1cfef63d9f1583eee07d6384756","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:24:17.842065Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:10:07.699225Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T23:25:51.674329Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"cited_work":{"arxiv_id":"2412.17637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17637","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"06a13ecb-fcc6-4852-a1e9-5d1c7c1357cb","year":2024},"citing_paper":{"arxiv_id":"2604.04419","last_updated":"2026-04-06T04:56:49Z","snapshot_observed_at":"2026-08-11T05:12:20.700971Z","submitted_at":"2026-04-06T04:56:49Z","title":"BoxComm: Benchmarking Category-Aware Commentary Generation and Narration Rhythm in Boxing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T19:10:07.699225Z"},"links":{"cited_paper":"/paper/2412.17637","citing_paper":"/paper/2604.04419"},"observation_digest":"sha256:c1265de59c58e45df2afdb13615627584ba6cb13777b5b576f0390d7e7cdaf9f","observation_id":"9412f7ea-5c9d-4aa8-b13c-2020277ff3bd","resolution":{"observed_at":"2026-05-10T23:25:51.682028Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"cited_work":{"arxiv_id":"2412.17637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17637","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"06a13ecb-fcc6-4852-a1e9-5d1c7c1357cb","year":2024},"citing_paper":{"arxiv_id":"2604.15736","last_updated":"2026-04-17T06:22:41Z","snapshot_observed_at":"2026-08-12T00:39:44.371309Z","submitted_at":"2026-04-17T06:22:41Z","title":"RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T08:38:27.081358Z"},"links":{"cited_paper":"/paper/2412.17637","citing_paper":"/paper/2604.15736"},"observation_digest":"sha256:0454256d19ceb6406fe471532d981b5d1d73cb2b3b8fee6bc637417de8b456b4","observation_id":"5ba8e445-dd51-4bbc-964e-2b2d7c78c243","resolution":{"observed_at":"2026-05-10T08:48:02.282471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.17637/citation-record","integrity":"/paper/2412.17637/integrity","json":"/paper/2412.17637/citation-record.json","paper":"/paper/2412.17637"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.683409Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.683409Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:1c184d4a4e56b51be31499e55fee06d231bd6d44bb53a740bdff5a5a32903fce","observation_id":"8b6535f5-61bb-4049-acd1-2fe75a8907d3","resolution":{"observed_at":"2026-08-11T05:24:17.683409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.273551Z","title":"Spice: Semantic propositional image caption evaluation, 2016","venue":null,"work_id":"9b611260-e04a-4797-804d-e8346d17d7cc","year":2016},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.687975Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:66e8ef208860e52d7ab2a895bfc26bfe0f80becdb332dd125bf301d9a0e9e873","observation_id":"e55d5ec1-caed-4f9d-bfec-fc3518af17e9","resolution":{"observed_at":"2026-08-11T05:24:18.277345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.263550Z","title":"METEOR : An automatic metric for MT evaluation with improved correlation with human judgments","venue":null,"work_id":"3a943f09-e76c-419e-a009-f336d1e42b07","year":2005},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.691725Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:a32e725cbc0e21f1caf9aa36a547b9d49f96a46575660d5daebc2d9ea7e82517","observation_id":"92643bb3-53a7-4370-82e1-8eb769cc1569","resolution":{"observed_at":"2026-08-11T05:24:18.267206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.253127Z","title":"P2anet: A dataset and benchmark for dense action detection from table tennis match broadcasting videos, 2024","venue":null,"work_id":"8f403521-3cf1-4827-b6b0-0dd7b70d674b","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.695503Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:4fdf8bd150b6e4e1b606114b3a91ebfe20aabf9982e63123ec6c9067cab3a90c","observation_id":"81aa4ebc-e894-4060-853e-1f87748c46ba","resolution":{"observed_at":"2026-08-11T05:24:18.257020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.699465Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.699465Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:f93d9a3960586158fb54eed1ed7e6b2223ad433ac4317da737cca3efd3ad21a0","observation_id":"d38a36f9-cdc7-4668-81bc-d2bff5b5d90e","resolution":{"observed_at":"2026-08-11T05:24:17.699465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.236387Z","title":"Autoeval-video: An automatic benchmark for assessing large vision language models in open-ended video question answering, 2024 a","venue":null,"work_id":"5cf3f5bf-9c8e-4cdd-8c1a-b797e883212c","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.703060Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:c7fc890691957530fe0c11cb062d55c036e493c9fdd87035f208b22e4918ceda","observation_id":"01fb1590-e1ab-4220-ae56-24e768fe32bf","resolution":{"observed_at":"2026-08-11T05:24:18.240253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.225905Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks, 2024 b","venue":null,"work_id":"db976fcd-27fa-475f-8493-0e8d60c892dc","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.706887Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:30bd2582f61754be467f6fb49da7088c872a70af9ab2b954b1039fc0f71a2d86","observation_id":"4885a10a-2b21-4003-bcdf-004717ab064e","resolution":{"observed_at":"2026-08-11T05:24:18.229784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.214933Z","title":"Sports re-id: Improving re-identification of players in broadcast videos of team sports, 2022","venue":null,"work_id":"b1426dc7-db8b-42b3-ab66-db566ce78567","year":2022},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.710525Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:ddc9a59558aba1ef9209e01f8fb10a474c5019110339b0fc0ed9de506bc39207","observation_id":"49590249-4420-459c-86fb-112a787c439a","resolution":{"observed_at":"2026-08-11T05:24:18.218808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.205374Z","title":"Seikavandi, Jacob V","venue":null,"work_id":"179f0bc0-0be2-48e0-957d-f0d4dc1b18d5","year":2021},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.713845Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:6dbb97119d2d5d5e7fe8175737c2dde6c58a0e10db5d33dc825f1d266df1a977","observation_id":"a09997db-526f-4884-9426-88cfca800994","resolution":{"observed_at":"2026-08-11T05:24:18.208594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.196065Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding, 2024","venue":null,"work_id":"b55a1c0a-e76e-4042-9ec5-35a10b287b09","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.717112Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:379491087bc65907b6fe657595e94207c7fc347adef54a68973101537d3c3b6f","observation_id":"bd052060-cac3-4270-9fd0-2fc4fa6f6edc","resolution":{"observed_at":"2026-08-11T05:24:18.199517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.187151Z","title":null,"venue":null,"work_id":"00d96456-681d-4045-a3b8-c5ded8e45037","year":2017},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.720502Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:56bdcc7f9a81df7f634d436d5de3620584039c4548cb2667549095f7e754b804","observation_id":"b6b813a9-e419-4a29-be55-548f911c8fe4","resolution":{"observed_at":"2026-08-11T05:24:18.190434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.176581Z","title":"Chatpose: Chatting about 3d human pose","venue":null,"work_id":"567f9fb7-0c95-401f-8c17-e6b5c37f047a","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.723725Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:4c55b5ae1e9d6d281f32bf9ede65f83884b7ca8f68af1e04b2043ab047300b91","observation_id":"201e4a8c-2feb-4498-8750-0a5980363c45","resolution":{"observed_at":"2026-08-11T05:24:18.180323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.731047Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.731047Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:4592d22f1e545f6fe1feb1daa85616d4dd33a49baff8ab3e0a20232ea351a5a2","observation_id":"ee94795f-eb39-4741-ba3c-83ad9bbe4e93","resolution":{"observed_at":"2026-08-11T05:24:17.731047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.159902Z","title":"Mini-internvl: A flexible-transfer pocket multimodal model with 5","venue":null,"work_id":"dedf2b4a-5e12-4565-b706-cd8ce15bf7c4","year":null},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.734832Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:a5868be786ce1c0a62c52e55ac28f8bf9a21dd820f5d83f3193070bec1593b2e","observation_id":"f753cd98-bff0-460d-ac1f-22c9961d08f5","resolution":{"observed_at":"2026-08-11T05:24:18.163828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.149996Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering, 2017","venue":null,"work_id":"9a2ccce9-0835-4f00-b2b2-d02a0abae1e1","year":2017},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.738244Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:a20558bc5a1056217b723a5a3ad490f69d3261a3c62e404cab14eabfced09e19","observation_id":"5dab9f72-2add-4922-81fc-e92616989e7d","resolution":{"observed_at":"2026-08-11T05:24:18.153707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.139315Z","title":"Chat-univi: Unified visual representation empowers large language models with image and video understanding, 2024","venue":null,"work_id":"2c93fbeb-9952-45cb-baa8-2c8182da0a2b","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.741346Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:f33afb27241a2627a14c6338af02aaf213ea0276fe940f6c5319e8e327cf4eee","observation_id":"f367ceff-082e-4348-8159-16ea306ededa","resolution":{"observed_at":"2026-08-11T05:24:18.143230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.744141Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.744141Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:c1c2b48a364c09e9e2a133be1052721857ef9619d5b52039e062f33f771444e2","observation_id":"7fa9b383-63be-4c0d-96d7-e83b3e6a0fb5","resolution":{"observed_at":"2026-08-11T05:24:17.744141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.123987Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark, 2024","venue":null,"work_id":"ad4d70a0-32de-4dc7-9fa9-eec29e62e0b6","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.746975Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:89784455c74b52690b44382621a1a41276888721e0b7ae739779d3b917afa618","observation_id":"d0c9d076-ab13-4cf7-ba77-886c8f7d102d","resolution":{"observed_at":"2026-08-11T05:24:18.127754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.749606Z","title":"Video-llava: Learning united visual representation by alignment before projection, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.749606Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:37415c883203217b064ee4ef8c7f67959ab303c5e405e126609fad32b880882b","observation_id":"63c2705e-2a9b-4b8f-94ca-53e371c0145a","resolution":{"observed_at":"2026-08-11T05:24:17.749606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.752192Z","title":"ROUGE : A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.752192Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:d0fd0de6f7a2a67ca4d0408cd41bc7c0445483d16dd01478b85bdc4198eeb4b2","observation_id":"a8cb6f5d-a8c1-4014-abe8-39cf5a8b1c5f","resolution":{"observed_at":"2026-08-11T05:24:17.752192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.101604Z","title":"Vila: On pre-training for visual language models, 2024","venue":null,"work_id":"d0b5a77c-406b-4afd-9816-cdff9a509e45","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.755116Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:8faffd19e6cfaa3103ae2d425d1fce18622a973ec46149e6e4df4df6780332fd","observation_id":"2dde1edb-3b92-4512-b7ae-b2c24263de32","resolution":{"observed_at":"2026-08-11T05:24:18.105842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.091012Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024 a","venue":null,"work_id":"b82afa2a-7b5f-4470-a3eb-f173a1bcd6fe","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.757693Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:6ead08cc4a70ccda3f83379f29564c8570d424d335743e54b4b4920c009b0b25","observation_id":"272a74c3-c035-45fa-b6d7-4b5bcc9a23e1","resolution":{"observed_at":"2026-08-11T05:24:18.094806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.079856Z","title":"Kangaroo: A powerful video-language model supporting long-context video input, 2024 b","venue":null,"work_id":"03bd12a4-9564-497f-965d-43e365eeaea4","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.760420Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:124ae63bf29d29a8788371a9b10751d535e5f1a95a5d8c4e3b34bd9e4393adea","observation_id":"5f312c6c-c424-4e8b-9f60-e60a9de35532","resolution":{"observed_at":"2026-08-11T05:24:18.083902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.069689Z","title":"Fineaction: A fine-grained video dataset for temporal action localization","venue":null,"work_id":"132582ca-0df4-4244-9584-8fdfc10e3ef7","year":2022},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.763437Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:19375c728481c36cd859c3da988f0a13cb8693fcef1a674eb8ba9c676609f3d7","observation_id":"d441747c-01e2-428a-a79d-1b96fcec39e9","resolution":{"observed_at":"2026-08-11T05:24:18.073076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.059576Z","title":"Tempcompass: Do video llms really understand videos?, 2024 c","venue":null,"work_id":"7f19078e-4f26-41c5-88b4-a8fbcc2fcf5d","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.767152Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:923fd1d6524986ea140383536474e0bf3d4036c51552092463a1ac58a8ff4e0d","observation_id":"a5b2fb07-83a1-4be2-8113-58add5c6f016","resolution":{"observed_at":"2026-08-11T05:24:18.063005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.049778Z","title":"Cross-block fine-grained semantic cascade for skeleton-based sports action recognition, 2024 d","venue":null,"work_id":"fae31cd3-7ce5-4549-a947-f5872943584b","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.770554Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:3bcc97e919a5db772ed4e3c2919d7c42b6ad385d937deb0f7881c80007be9d72","observation_id":"495a771b-3799-45de-8bc8-c6f62180a8e1","resolution":{"observed_at":"2026-08-11T05:24:18.053087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.773955Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.773955Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:cb85dc380fdaa6034db339302b638fbd6c63ac48ebef0df6a0a87711bf4507c9","observation_id":"1bf485d7-49e8-4bf9-87c5-ea611345cbe1","resolution":{"observed_at":"2026-08-11T05:24:17.773955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.777547Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.777547Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:880e93f3a4f306f4ec60420eefe1ff145991da77ef941dcb552d5f457822a43b","observation_id":"914eb97b-14ed-45ae-b0f7-c9c1f81aa64d","resolution":{"observed_at":"2026-08-11T05:24:17.777547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-13T05:16:05.220753Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-11T05:24:17.780895Z","title":"Video-bench: A comprehensive benchmark and toolkit for evaluating video-based large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.780895Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:f106fc9a73fed89f2f378b03cd01c73399e3eda61db79ebbb051a15127fd1a65","observation_id":"790bf743-95bc-4de3-be39-e8ff36a81b80","resolution":{"observed_at":"2026-08-11T05:24:17.780895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.027714Z","title":"Video-bench: A comprehensive benchmark and toolkit for evaluating video-based large language models, 2023 b","venue":null,"work_id":"5fde3ee0-2897-452d-ab28-4d1d8c88d987","year":2023},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.784738Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:36eae62f1bdbb1b21e3eeda34efef743100e25581b09ff7f704d7ddef4b22133","observation_id":"00e92d4e-b813-4d32-9c87-1de79dd35e53","resolution":{"observed_at":"2026-08-11T05:24:18.031890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.016249Z","title":"B leu: a method for automatic evaluation of machine translation","venue":null,"work_id":"2060bd04-14ac-4fbe-bf26-f67b75c87d46","year":2002},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.787974Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:52b1db3bb6ddd2e0824119cdfa03c91cbfdd99aaec90014d5638aaca488f5739","observation_id":"318f1244-9d23-4391-96f8-c4276da2d98e","resolution":{"observed_at":"2026-08-11T05:24:18.020253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.004945Z","title":"Perception test: A diagnostic benchmark for multimodal video models, 2023","venue":null,"work_id":"05c2eb0b-350e-4d7c-a12f-c2d71df73ef0","year":2023},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.791466Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:eb850263f8c7c07477236e4104f259eabecb20b33e9324c68cf048993c59c7d3","observation_id":"1e62d750-37c1-48f2-a52e-ff97f2b59ddd","resolution":{"observed_at":"2026-08-11T05:24:18.009190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.991313Z","title":"A survey of video datasets for grounded event understanding","venue":null,"work_id":"252ecd16-76d0-4f02-85d1-d512086cdaa7","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.794736Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:f00f0f8d681676dc5f387dc846455ad11848688097014913d58cc30a55d0c730","observation_id":"7ec357c2-f255-4e71-b76b-c16c38beb508","resolution":{"observed_at":"2026-08-11T05:24:17.996400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.797956Z","title":"Finegym: A hierarchical video dataset for fine-grained action understanding, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.797956Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:d1e96a6d66e336ed7d632034eaf5601ac9fa3c0cf48f1994a94e76732994962a","observation_id":"194d3318-23d9-447d-b2c2-4ee768d1fea6","resolution":{"observed_at":"2026-08-11T05:24:17.797956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.801306Z","title":"Visual cot: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.801306Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:b16dbcd23eeba57ae22755b07414da1a573c58e78ae47128d30aa851be498520","observation_id":"1ad71774-beb3-43d1-9c46-8f1b44452bf0","resolution":{"observed_at":"2026-08-11T05:24:17.801306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.969336Z","title":"Playertv: Advanced player tracking and identification for automatic soccer highlight clips, 2024","venue":null,"work_id":"17252c0e-5dbc-4ca6-a9a9-e980e344b29c","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.804672Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:5a547b364ec48992ab0685b66ac74a9adcf812055ea89f27eb076b8807e0fbea","observation_id":"22ceb1ea-6e79-4b8f-a840-4c7cec682770","resolution":{"observed_at":"2026-08-11T05:24:17.973119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.959321Z","title":"Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy","venue":null,"work_id":"56877029-68b9-43f6-8483-1dfec78129eb","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.808227Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:40699a6c8f484b71658ec33ae5367ed21defd6f04986b7751a193736c65e27b5","observation_id":"0e4d8d06-c469-4c5d-b539-8f68e0a4bde8","resolution":{"observed_at":"2026-08-11T05:24:17.962914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.5726","last_updated":"2015-06-03T01:42:20Z","snapshot_observed_at":"2026-08-14T23:10:48.763001Z","submitted_at":"2014-11-20T23:54:35Z","title":"CIDEr: Consensus-based Image Description Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.5726","snapshot_observed_at":"2026-08-11T05:24:17.811515Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.811515Z"},"links":{"cited_paper":"/paper/1411.5726","citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:92abe0b2b1dec86fc27ad7c3262d94fb7f6725d3a05676355d72d34cb0c2b2df","observation_id":"712f6b79-4947-472c-a454-94d31e375393","resolution":{"observed_at":"2026-08-11T05:24:17.811515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.815018Z","title":"Lvbench: An extreme long video understanding benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.815018Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:f5da96822399791f847194082f0752ec66a15b8cf92558d7c98281b4afc06cbc","observation_id":"48281dc9-9464-4065-9549-cac8cc4408b2","resolution":{"observed_at":"2026-08-11T05:24:17.815018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.818259Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.818259Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:2993e972ca5d17f194741bebd7876ffc079b79f11e7c8c59c51a1461351df0f7","observation_id":"9138a27a-d2d9-4035-8d99-52e1913656b4","resolution":{"observed_at":"2026-08-11T05:24:17.818259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.938418Z","title":"Sportshhi: A dataset for human-human interaction detection in sports videos, 2024","venue":null,"work_id":"2255e99e-a7b1-40ee-aa5a-fd5f7f51f5fe","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.821236Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:3b60421ea450cbe3683739291ceff4bf38be42c3e62b4dff43ac6fddf1af0dbe","observation_id":"2b9fd42c-5dab-4c68-852f-ececbfabeb6a","resolution":{"observed_at":"2026-08-11T05:24:17.941986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.929242Z","title":"Next-qa:next phase of question-answering to explaining temporal actions","venue":null,"work_id":"061ce486-ffd4-47ac-aa8e-143301089fe3","year":2021},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.824496Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:77f235a80fb3d35351bd661e1eb3f5be5bc4d0c0fa2646dd8bc7ea2541162ebb","observation_id":"191afc41-22d3-4cb1-8203-7215a9c1bc65","resolution":{"observed_at":"2026-08-11T05:24:17.932170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.919972Z","title":"Video question answering via gradually refined attention over appearance and motion","venue":null,"work_id":"b402fe5b-c51f-4e3d-ab8e-0f9ce82b6e73","year":2017},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.827835Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:111f359a4817e6f657c73ed11936d338ce6e673c5dfc388aef36fcf81f8d7cb0","observation_id":"5a12612e-03b0-4cd0-92ba-11cf5040ecb1","resolution":{"observed_at":"2026-08-11T05:24:17.923406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.908452Z","title":"Youku-mplug: A 10 million large-scale chinese video-language dataset for pre-training and benchmarks, 2023","venue":null,"work_id":"494b2757-71b0-468f-b000-1f4a0fa6917d","year":2023},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.830956Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:115bda6d22b2174b2d81e6c32a58b47619c0ac2fd632d24fac138e2413bddb58","observation_id":"6ece9f76-4af6-42f9-8fe9-ec73996239ee","resolution":{"observed_at":"2026-08-11T05:24:17.913531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.834360Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.834360Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:73c910a9185c6e5b0783e1e5f304e5b8fa80fc50620fba1cd0653454c587f9b3","observation_id":"2f72312a-1c0c-4b73-93f4-b98ac8a319bb","resolution":{"observed_at":"2026-08-11T05:24:17.834360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.837559Z","title":"Long context transfer from language to vision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.837559Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:d47db6ad4fb870edf761b7d5f73f8bf917098fe14a4fa56743d0dbb6f7ac9c9a","observation_id":"ec67df3c-0e60-44f4-b323-567b1480ea59","resolution":{"observed_at":"2026-08-11T05:24:17.837559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16038","last_updated":"2024-01-30T14:37:10Z","snapshot_observed_at":"2026-08-13T04:31:06.353491Z","submitted_at":"2024-01-30T14:37:10Z","title":"A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16038","snapshot_observed_at":"2026-08-11T05:24:17.842065Z","title":"A survey on generative ai and llm for video generation, understanding, and streaming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.842065Z"},"links":{"cited_paper":"/paper/2404.16038","citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:194fb2bbce0d8cc5757d2fb575a4ee73e7c2a3b57e6f023ef0014cfc96137555","observation_id":"f966328a-0266-435b-8b64-9392d51e1834","resolution":{"observed_at":"2026-08-11T05:24:17.842065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T22:04:04.093867Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 2 inbound Pith citation observations for arXiv:2412.17637."}