{"as_of":"2026-08-15T16:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:533170ea5fd9d836b7d1916f35a35b978c3b1c47ac38f8345aa7d77c0205b997","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:06:05.171159Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14688/citation-record","integrity":"/paper/2411.14688/integrity","json":"/paper/2411.14688/citation-record.json","paper":"/paper/2411.14688"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:04.828160Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.828160Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:cfc408deeaf11dd44114cda9ad9981df4fce8bb41b43aa4b76b572569621edbe","observation_id":"9fc1bf43-b827-4330-835c-6a2b45ab28c6","resolution":{"observed_at":"2026-08-12T15:06:04.828160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.421224Z","title":null,"venue":null,"work_id":"92555f93-caca-424a-808c-6255117ec726","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.833355Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:150a492426cf8c7bceac752c3aa44800d2f4fe33e37e35bf5693b11985b92ef2","observation_id":"58eda270-95ed-4593-814f-882abfb3470e","resolution":{"observed_at":"2026-08-12T15:06:06.426126Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:04.837965Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.837965Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:54483ed62fcf5ddde578836bf8394eec2cb490afab1623333020cfa2098126cc","observation_id":"c5f0066a-1638-40ab-93fa-266c263e0cce","resolution":{"observed_at":"2026-08-12T15:06:04.837965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-08-15T09:06:23.943892Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-12T15:06:04.842945Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.842945Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:b491c154f02d4e5716b749a47a33857d7d371df7f275f15b0b951468efecc606","observation_id":"1281e890-ec4b-4755-ae78-099640dadade","resolution":{"observed_at":"2026-08-12T15:06:04.842945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.397606Z","title":"Recur- rent memory transformer","venue":null,"work_id":"2b5c34bd-7368-4a9a-ba81-e092314fe88d","year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.847643Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:5f2bfda68b0f88010ce7575125cde4925d5c566c229c050e6f1f2c9efb94c1d0","observation_id":"3f418b2a-b1fa-4535-bbab-388e3ab1876d","resolution":{"observed_at":"2026-08-12T15:06:06.402403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:04.852261Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.852261Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:38c7f931dbeafd6000846eaab79d0088f0f3ce444cb060509a261095900f44d5","observation_id":"4b1e360d-70a1-4761-97a5-f603fb9458dc","resolution":{"observed_at":"2026-08-12T15:06:04.852261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-12T15:06:04.856994Z","title":"PaLI-X: On scaling up a multilingual vision and language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.856994Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:b2e953df862bbdd59fc2201923f3a27fe63d20f78bc0e1cf8ae0437bc0d723ad","observation_id":"0933075a-1a6f-4b96-9f7e-6a0273406282","resolution":{"observed_at":"2026-08-12T15:06:04.856994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.373982Z","title":"PaLI: A jointly-scaled multilingual language- image model","venue":null,"work_id":"43ced058-063c-49d1-ae2e-ccfdc2f29a34","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.861858Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:e6957706222c205bb7ec920feb064de07b24e327bb060c7aa193ebdbfc76282c","observation_id":"61cdd851-19ad-4708-b862-1df2747700ec","resolution":{"observed_at":"2026-08-12T15:06:06.378746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03204","last_updated":"2023-05-04T23:27:21Z","snapshot_observed_at":"2026-08-13T11:48:58.488724Z","submitted_at":"2023-05-04T23:27:21Z","title":"VideoOFA: Two-Stage Pre-Training for Video-to-Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03204","snapshot_observed_at":"2026-08-12T15:06:04.866401Z","title":"Videoofa: Two- stage pre-training for video-to-text generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.866401Z"},"links":{"cited_paper":"/paper/2305.03204","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:3b84e34fb9b60397ad27f40709854ce10dd0b0c52f411c4069076cb70724665d","observation_id":"322233ca-9b62-4e1c-8271-0d32a8f6c89e","resolution":{"observed_at":"2026-08-12T15:06:04.866401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.359824Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":"ba261ba4-af34-4a26-86d5-abd9db008e73","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.871346Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:59ccc62e6692402bdb9c6419011b30371692a7663167f0df62ebb2475c4d7062","observation_id":"476c7f7b-ebdf-4ebc-b6aa-c61fb20c7ffa","resolution":{"observed_at":"2026-08-12T15:06:06.364399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01680","last_updated":"2022-07-26T18:33:10Z","snapshot_observed_at":"2026-08-13T19:38:28.076200Z","submitted_at":"2022-04-04T17:51:20Z","title":"TALLFormer: Temporal Action Localization with a Long-memory Transformer","version":2},"cited_work":{"arxiv_id":"2204.01680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.01680","snapshot_observed_at":"2026-08-12T15:06:05.601024Z","title":"TALLFormer: Temporal Action Localization with a Long-memory Transformer","venue":"cs.CV","work_id":"1d33577e-0c2e-44c3-8fd0-9ded71a15384","year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.875901Z"},"links":{"cited_paper":"/paper/2204.01680","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:3f7b2866ac733039c11e4e9e6fbb2068a8747349504134f6921b24f447b47740","observation_id":"db2c8653-8ef1-4f0a-8d31-e135ea8b7ea5","resolution":{"observed_at":"2026-08-12T15:06:05.606074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.345150Z","title":"Monotonic chunkwise attention","venue":null,"work_id":"2297c1e2-3ed0-4cca-80d1-93f110164b91","year":2018},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.881088Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:501b5c5d3bc3f38ad4787ce189a8bca7c00e756396a33e7771250a1fffb4a81f","observation_id":"62d8344d-51fd-4c6b-bae4-521dc7e62b3d","resolution":{"observed_at":"2026-08-12T15:06:06.349731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-12T15:06:04.885366Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.885366Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:f0e008135ac127d4674075184242e4807bbf447fd18163df2c65f29cb9ccee01","observation_id":"2f2ed543-2ca6-41ab-bcd2-41e67c5c429a","resolution":{"observed_at":"2026-08-12T15:06:04.885366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.330336Z","title":"An empirical study of training end-to-end vision-and-language transformers","venue":null,"work_id":"a0cbd52b-7620-4022-ae92-6ed02525268d","year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.890245Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:8b43da7cc603afcd4f2b467b485116e85d762810d47b2284c4f6e3f72b3eddae","observation_id":"5b6b29fb-8f0a-4264-899a-69afab6caf9c","resolution":{"observed_at":"2026-08-12T15:06:06.335076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2111.1268","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.561309Z","title":"Violet: End-to-end video-language transformers with masked visual-token mod- eling","venue":null,"work_id":"a4d32296-397c-45f1-bc74-f780c60ea267","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.894546Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:70cffeb7cf0cb165444aef4e1143944d152b3c86b8cf2c0bc36d0a3ccd1f904c","observation_id":"64219baf-12c1-41bb-b565-5477d750100b","resolution":{"observed_at":"2026-08-12T15:06:05.568804Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:04.898868Z","title":"Soda: Story oriented dense video captioning evaluation framework","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.898868Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:f272ddc17446b2727d397b0d4de37a28e82ac95f20daebda4a6c80443bb0e9d2","observation_id":"8dd6f2c7-edaa-4208-9707-51c3bd6387fb","resolution":{"observed_at":"2026-08-12T15:06:04.898868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.306103Z","title":"Mist: Multi-modal iterative spatial- temporal transformer for long-form video question answer- ing","venue":null,"work_id":"680b2e31-1ecf-4896-b97b-680f5cd43fc8","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.903286Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:b1d9e102883ae57f5ba46ea3c0a6451d69abde6ddfda7059e227b232900a49ce","observation_id":"bf836ebb-e58f-4baf-9c41-2d409e04da11","resolution":{"observed_at":"2026-08-12T15:06:06.310920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.291609Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":"d476a7b7-a611-4ca0-a261-a0aae7c94815","year":2017},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.907497Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:79888ce7bb965222964df2ef1b10621ea250fb94656ba751ace06d38ab135a13","observation_id":"779e2d54-5c99-4f82-aec2-59951c501850","resolution":{"observed_at":"2026-08-12T15:06:06.296440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.277142Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"f430b3fe-9f6a-41ec-be42-3196596ff3ae","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.911726Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:1b01cb634dd1e1f2eebae6da9199060f92d891802d3c2370d1d348763de86264","observation_id":"cb1b91ff-dee4-45ba-bdee-9f5c0a287456","resolution":{"observed_at":"2026-08-12T15:06:06.282074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.263189Z","title":"Multimodal pretraining for dense video cap- tioning","venue":null,"work_id":"6612dde9-5401-457e-95cf-8106559fe16e","year":2020},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.916036Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:429c931d92835dac21531fb439986bef3fad198217b8b8844f213cd9d548def1","observation_id":"eb4d5fbf-0614-410f-b635-255f322addb1","resolution":{"observed_at":"2026-08-12T15:06:06.267858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.248788Z","title":"A better use of audio-visual cues: Dense video captioning with bi-modal transformer","venue":null,"work_id":"7e9b4081-150c-42e1-9b13-016f10a33e78","year":2020},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.920357Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:194e5af8d4be88f213dc6ed4e09568f82b4876ee71b06941d1f3dbef6b66c992","observation_id":"e534e57a-ec11-4924-91e7-549b3c17c99b","resolution":{"observed_at":"2026-08-12T15:06:06.253553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.234009Z","title":"Long movie clip classification with state-space video models","venue":null,"work_id":"6e085770-5132-4753-94e2-fd43cea19388","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.924749Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:a4de3ee125e3d618b885c3876567b9b301d042698aa9540e4ccd390aa5a86881","observation_id":"28f5fd1d-56f8-48f4-a619-f5a5ca7e567b","resolution":{"observed_at":"2026-08-12T15:06:06.238572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.218526Z","title":"Perceiver: General perception with iterative attention, 2021","venue":null,"work_id":"0979c4ba-d489-4b30-adae-e7ce86d0c82f","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.929930Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:3c20e23721557db1f7487c14e22e3172af05eccfa514089c8e251c30d57e2e5a","observation_id":"2ebbb894-1c9c-47ea-a25e-cc09b23d77d6","resolution":{"observed_at":"2026-08-12T15:06:06.223759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.202952Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"64964cce-9904-477b-be68-cc2c50c7b6df","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.934248Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:110aebc71c7186cdf4eda9816f0be3f6338169509e61f03da5b86469ff6b1142","observation_id":"866920ec-e48c-4654-a1d0-197ef9477bd4","resolution":{"observed_at":"2026-08-12T15:06:06.207617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-12T15:06:04.938660Z","title":"The ki- netics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.938660Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:4d65b2b124360bb81233eb9f9697b5838c0af9d5b786678556f4a06782206e87","observation_id":"634c3a2a-8ba3-4870-b3e7-b5d1ada9c606","resolution":{"observed_at":"2026-08-12T15:06:04.938660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.187585Z","title":"Dense-captioning events in videos","venue":null,"work_id":"848c7d30-139e-4c36-811f-0ba769f8f9d0","year":2017},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.943485Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:39fd78e27a833181bf32b88838e080bcb359c815a9f7e26c535e532d99b528f8","observation_id":"7b2d3f33-9c37-433f-b9a0-d5471995577a","resolution":{"observed_at":"2026-08-12T15:06:06.192583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.172461Z","title":"MaMMUT: A simple architecture for joint learning for mul- timodal tasks","venue":null,"work_id":"b0988d6a-1d35-4098-97cf-e85f8ea60577","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.948145Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:2b95769735551baa113d718f2b12cb18d2942c249c52d4661e3b8ae553f3bddc","observation_id":"ab86b914-033e-4fe5-86ec-c876dbe04c34","resolution":{"observed_at":"2026-08-12T15:06:06.177370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.157243Z","title":"Selvaraju, Akhilesh D","venue":null,"work_id":"8b29cea9-7b7f-432f-9d06-b5802176288f","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.952500Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:2eb750a6f6b6c466fa6a634bd13560f9dcb21e47b31bcb5bc55f6ded352fc205","observation_id":"93a06bfb-34e4-4d4f-81f5-7c577724b57e","resolution":{"observed_at":"2026-08-12T15:06:06.162380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-09T08:39:37.884261Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-12T15:06:04.956799Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.956799Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:00b3ea4fbb338d7c60ddebe17ab0f2350b0e4f29c0c7cb9c13796f72fd9fdb12","observation_id":"2073b075-6195-4090-a649-687ad2ea368c","resolution":{"observed_at":"2026-08-12T15:06:04.956799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.141960Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"9abcc6c2-3d54-4aab-991c-1a9decd984da","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.961415Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:1f7815688663fc21336522412302dbff27a11b18d062a4731b67619d1eb39eb3","observation_id":"16497643-3609-4795-953f-103946ee1173","resolution":{"observed_at":"2026-08-12T15:06:06.146858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:04.965854Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.965854Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:dd26ac8f2f5a279d215f2230be938d0f472fdb817ebd2df2dbb4c92590790a59","observation_id":"ccea7bdf-7641-42e0-b7ec-5256e04f62a9","resolution":{"observed_at":"2026-08-12T15:06:04.965854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.118409Z","title":"Eclipse: Efficient long-range video retrieval using sight and sound","venue":null,"work_id":"21bbf8b5-bc4f-4019-be1c-084fea095b17","year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.970155Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:0a63b19f108999ba8710db832830bad24f1d15dc6d5ec5755484dc1bf051fcfb","observation_id":"259d49b3-f1ee-41eb-aaf1-d1695b76edfe","resolution":{"observed_at":"2026-08-12T15:06:06.123020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.103931Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":"3df22481-5efd-452d-b3ef-d441da9f3143","year":2019},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.974651Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:202b2c3deddcb37dd52b66749b225f2144e42bf662d87b215cdf4c25e7d8d7e1","observation_id":"508faf4f-05af-4693-85a3-1d318c14ad52","resolution":{"observed_at":"2026-08-12T15:06:06.108611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-08-13T15:21:53.358272Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-12T15:06:04.978924Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.978924Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:5d12ec23bc5369fe031b7b26cc196b9c0bf245f70a9d61c4c8da09cf826d427c","observation_id":"4a015e24-5651-49eb-89cf-2299cc5cf88a","resolution":{"observed_at":"2026-08-12T15:06:04.978924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06353","last_updated":"2020-09-15T13:27:13Z","snapshot_observed_at":"2026-07-06T08:57:29.493849Z","submitted_at":"2020-02-15T10:03:25Z","title":"UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06353","snapshot_observed_at":"2026-08-12T15:06:04.983697Z","title":"Univl: A unified video and language pre-training model for multimodal understanding and generation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.983697Z"},"links":{"cited_paper":"/paper/2002.06353","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:94f1ec6f61e5fcf4b7859638a86b7196a1b170791a072976f9b2c30dd28598c9","observation_id":"2e37f6b3-5420-48b1-8ef4-4ef8f2d6b586","resolution":{"observed_at":"2026-08-12T15:06:04.983697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-12T15:06:04.988340Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.988340Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:5b8fd38b038c8c8b5852992506c256472563dfecaaef3bdfe59eab8c6c3fb5fb","observation_id":"544c7b6c-8643-477f-b6c9-ee214541a8b9","resolution":{"observed_at":"2026-08-12T15:06:04.988340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.089900Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"5178c0f5-84e1-4537-ba02-d761f9b0d680","year":2019},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.992820Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:454bb0a301efe4694cea1b9620b780942beb106c52c154bc9996a50c35ac42bd","observation_id":"f99164ad-09ba-48b6-9d4f-52c978b8cdf9","resolution":{"observed_at":"2026-08-12T15:06:06.094585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.075561Z","title":"Moments in time dataset: one million videos for event understanding","venue":null,"work_id":"569ab867-d829-4e41-8197-be38798d6404","year":2019},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.997164Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:10d0deb88aca28d281ff8b83c96aab770984e2da3ebf7bab5cd0528b773a908b","observation_id":"e7c291c4-96bf-4303-ba3f-4eaafe0b1ad6","resolution":{"observed_at":"2026-08-12T15:06:06.080134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.060965Z","title":"Re- thinking video vits: Sparse video tubes for joint image and video learning","venue":null,"work_id":"dcb9e951-0564-4ae6-9593-de9952dfeb83","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.001535Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:2058eab58ea92ae16cb598cc387a2c81fd482fcbab74275ea87d080cbfed8013","observation_id":"269d64be-8381-4c1f-bdfe-c09523415829","resolution":{"observed_at":"2026-08-12T15:06:06.066168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.045945Z","title":"Dynamic pretraining of vision-language models","venue":null,"work_id":"65d96a93-ff32-44df-9b8d-746419e4b6b8","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.005634Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:935c3d5fc1cdf4e986c67585a67dd324fcaf760f12e3f7482dee4f47baf4a911","observation_id":"6df7cbe3-23f8-48ea-8e27-a3e6b204789d","resolution":{"observed_at":"2026-08-12T15:06:06.050986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.030560Z","title":"Mirasol3B: A multi- modal autoregressive model for time-aligned and contextual modalities","venue":null,"work_id":"3f2056b8-a31b-400c-bfbb-a5f5acdec317","year":2024},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.010128Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:835d48d7599523bd392742861016cc506ab41519b740581b5b368c63221d3806","observation_id":"4c1d06c5-315f-4441-b52c-d889c3de41f7","resolution":{"observed_at":"2026-08-12T15:06:06.035370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.015513Z","title":"Timechat: A time-sensitive multimodallarge language model for long video understanding","venue":null,"work_id":"0ea74467-7861-454c-b374-5774876d4561","year":2024},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.014494Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:1b6dd6c321a62dbbf78b8de64a2cc1465d4b07de2662855f29a5d2d532761d52","observation_id":"70723b90-532a-4496-baa8-fe1dbfba2780","resolution":{"observed_at":"2026-08-12T15:06:06.020522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.000079Z","title":"Ryoo, AJ Piergiovanni, Anurag Arnab, Mostafa Dehghani, and Anelia Angelova","venue":null,"work_id":"64003429-27f7-498d-87b4-4dc4b1deb3e4","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.019001Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:8d21b629cea10de55036fac689b9803b5b740ae8d35bea63e239a91853cacabe","observation_id":"eecb69be-a250-46cb-a0e7-46e88aa337b4","resolution":{"observed_at":"2026-08-12T15:06:06.005351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.985315Z","title":"Ryoo, Keerthana Gopalakrishnan, Kumara Ka- hatapitiya, Ted Xiao, Kanishka Rao, Austin Stone, Yao Lu, Julian Ibarz, and Anurag Arnab","venue":null,"work_id":"8e2afb36-8d8b-4d2e-abd5-4cc5f3945f79","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.023173Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:6e0770eb5a81de26a44b591dd1b650fb863502b47cce0c5b1df8d64f850bbdf9","observation_id":"682ac631-1b37-4e47-9e54-d74537cbd27b","resolution":{"observed_at":"2026-08-12T15:06:05.990104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.970846Z","title":"Tridet: Temporal action detection with relative boundary modeling","venue":null,"work_id":"f825d455-bf6f-4f7e-ac8f-e7050767779b","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.027594Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:2b81a645d44b43faf2cae7fe37c0fe55f0fcb38eb4c30ae4fc695e2939e6889c","observation_id":"fe32cb33-f5a8-42cc-9296-cf38edf05b5b","resolution":{"observed_at":"2026-08-12T15:06:05.975563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.032048Z","title":"Flava: A foundational language and vision alignment model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.032048Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:2fd0dbff34c46e6dd30e6aa72fd26ab8e4cd2b61c4d8a89ce4c80d49d95314aa","observation_id":"6873270e-a51b-4777-aa9c-5a4191ca1ef4","resolution":{"observed_at":"2026-08-12T15:06:05.032048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.947390Z","title":"Ucf101: A dataset of 101 human action classes from videos in the wild","venue":null,"work_id":"89a5f83a-5d26-4761-bc92-9925ae779cd2","year":2012},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.036535Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:0d35eaf023fd61f80a3b1b8919b5505b356249d72fc0cfd9419fcfe465c845fe","observation_id":"cc54361f-70fe-4445-813e-2264bf0e17bc","resolution":{"observed_at":"2026-08-12T15:06:05.952057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.932324Z","title":"Long-form video-language pre- training with multimodal temporal contrastive learning","venue":null,"work_id":"ca3f738a-317c-455d-9768-8e0776f3dc49","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.040934Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:f051486592acc87cf544c2e0a4ce696836807381e462ee53b3deeffd38990edb","observation_id":"26e32ad5-2ac1-43f4-ad44-734d59ebf866","resolution":{"observed_at":"2026-08-12T15:06:05.937238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.917381Z","title":"Lxmert: Learning cross- modality encoder representations from transformers","venue":null,"work_id":"602d970c-5c57-4cca-bde6-58405c3e1907","year":2019},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.045382Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:ceca3ded6cadd6a455b5670e06ce359025bfc5caae69f4f6514c3290ef6926de","observation_id":"72a9ef8c-a6be-41f9-87f5-904215e960a3","resolution":{"observed_at":"2026-08-12T15:06:05.922326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06615","last_updated":"2021-10-13T10:17:06Z","snapshot_observed_at":"2026-08-13T17:54:02.273148Z","submitted_at":"2021-10-13T10:17:06Z","title":"CLIP4Caption: CLIP for Video Caption","version":1},"cited_work":{"arxiv_id":"2110.06615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.06615","snapshot_observed_at":"2026-08-12T15:06:05.347504Z","title":"CLIP4Caption: CLIP for Video Caption","venue":"cs.CV","work_id":"93cadd35-2363-47e4-8fee-909746aabc68","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.049820Z"},"links":{"cited_paper":"/paper/2110.06615","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:da09ffc58765fbb3583ce15bce0ef97ee7eace060d0af540f4b083a49513e5d0","observation_id":"eb9d6011-49f0-4598-a980-1aae07ec971d","resolution":{"observed_at":"2026-08-12T15:06:05.353751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.054676Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.054676Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:83c4a3550ec4be798c4f3b31b5dbc3f7e281a5ed05402404b11d24676239d2ff","observation_id":"abaf2d17-1bd9-45b9-b3fa-65160eba14cb","resolution":{"observed_at":"2026-08-12T15:06:05.054676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.893094Z","title":"Bidirectional attentive fusion with context gating for dense video captioning","venue":null,"work_id":"48a17bff-8826-4fb6-9649-9fe19f4195ea","year":2018},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.058944Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:540eb6c57b6cace11056727938707f8ff3db5c7c0ce0a58fa19a6f2e46ceea36","observation_id":"84909b79-6f9a-438a-9985-b6e0e2125196","resolution":{"observed_at":"2026-08-12T15:06:05.897753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-12T15:06:05.063232Z","title":"Git: A generative image-to-text transformer for vision and language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.063232Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:f06d1cb930a4555d616eb210e21bf5af92c3328bc91df2fafdec6b0db9b89135","observation_id":"ecb8d9d6-4849-4fc7-a288-f1d99e3102e3","resolution":{"observed_at":"2026-08-12T15:06:05.063232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.878222Z","title":"Omnivid: A generative framework for universal video understanding","venue":null,"work_id":"38db4bf4-eed3-4ca5-a9eb-1aee00b7aaf8","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.067933Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:c7c3271141614c56759ff918fa8479bd4ac1f4debaed4d7d26376207b1f74564","observation_id":"25f47987-40a1-46cb-8ca5-451b566e3853","resolution":{"observed_at":"2026-08-12T15:06:05.883020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03052","last_updated":"2022-06-01T09:24:35Z","snapshot_observed_at":"2026-08-13T16:45:42.126962Z","submitted_at":"2022-02-07T10:38:21Z","title":"OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03052","snapshot_observed_at":"2026-08-12T15:06:05.072176Z","title":"Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.072176Z"},"links":{"cited_paper":"/paper/2202.03052","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:d621b6d78f40538a21d84d06dc0939edea4e84267c5d40c69bc40d291f380c9c","observation_id":"ad699342-6b75-4888-a562-47e8d54a4a59","resolution":{"observed_at":"2026-08-12T15:06:05.072176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.862684Z","title":"End-to-end dense video captioning with parallel decoding","venue":null,"work_id":"aeef804e-d7e2-4a4c-89d8-7448d4905080","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.076799Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:05bb2cf6353f0bc404082fbf3413ef4edece0af79924bfcaaaa84037941dc0d8","observation_id":"2844a8a3-3fc3-485b-b257-5efe1d665c05","resolution":{"observed_at":"2026-08-12T15:06:05.867617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-13T14:40:51.995893Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-12T15:06:05.081141Z","title":"Image as a foreign language: Beit pretraining for all vision and vision- language tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.081141Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:91433a941b1cc68c0e7fa8d29fd8efea1036b6a39da89b7b36c317187962be0d","observation_id":"3866e6e4-4cd8-4a15-8fd0-c16be4a0a892","resolution":{"observed_at":"2026-08-12T15:06:05.081141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-12T15:06:05.085716Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.085716Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:d77bdb45759dc0c4465fa5d77ee8bf41cd9a69a5393f6a26ab252644727b67c0","observation_id":"77202398-63d6-4180-bcfc-77319f3070f1","resolution":{"observed_at":"2026-08-12T15:06:05.085716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-12T15:06:05.090407Z","title":"Simvlm: Simple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.090407Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:190577353d67526c1f6fdea8f7230a6f49dfdd266b985dcf3e64080db8fa3635","observation_id":"7c79ed25-29e0-4b4f-a0ea-a4ffcf36494a","resolution":{"observed_at":"2026-08-12T15:06:05.090407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.847809Z","title":"Vl-bert: Pre-training of generic visual- linguistic representations","venue":null,"work_id":"97ea6b0a-9e17-456a-a1ef-045db0c5da7e","year":2020},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.095077Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:6bc7eff6ab4161d31fe49180d1dafe8782ee4396dd78b0b0f8743c9412e86b11","observation_id":"dedb013e-e3c7-44ee-9654-c3856e996084","resolution":{"observed_at":"2026-08-12T15:06:05.852537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.833561Z","title":"Towards long-form video understanding","venue":null,"work_id":"47d9b072-2dbb-43b6-9e9b-ae25de492043","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.099227Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:c288b71b27eed9fcd0eda4f94666a7045eb4b012161947653c2745e624c276d5","observation_id":"3a2d0625-250b-4b1d-a5ab-ee791bbe4902","resolution":{"observed_at":"2026-08-12T15:06:05.838141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.818645Z","title":"Dibs: Enhanc- ing dense video captioning with unlabeled videos via pseudo boundary enrichment and online refinement","venue":null,"work_id":"525e8575-3eb0-4623-9c85-761264760747","year":2024},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.103524Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:bb8619c341c877b5218c07d710e08174b3ec9a6abf230675fd52ced2cef1249c","observation_id":"0ffc5d5d-b2d5-41a5-abc9-b57b2ba4d9fb","resolution":{"observed_at":"2026-08-12T15:06:05.823791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00402","last_updated":"2023-02-01T12:40:03Z","snapshot_observed_at":"2026-08-13T12:53:33.421505Z","submitted_at":"2023-02-01T12:40:03Z","title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00402","snapshot_observed_at":"2026-08-12T15:06:05.108091Z","title":"mplug-2: A modularized multi-modal founda- tion model across text, image and video","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.108091Z"},"links":{"cited_paper":"/paper/2302.00402","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:471f934c68413caf18fa7c847a3bfa125dd2a7a6388b1991996a0517675db5ab","observation_id":"484716e0-2545-429b-98de-c9ffdd87a54e","resolution":{"observed_at":"2026-08-12T15:06:05.108091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04979","last_updated":"2023-03-15T06:48:23Z","snapshot_observed_at":"2026-08-13T13:24:34.796483Z","submitted_at":"2022-12-09T16:39:09Z","title":"VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04979","snapshot_observed_at":"2026-08-12T15:06:05.112688Z","title":"Videococa: Video- text modeling with zero-shot transfer from contrastive cap- tioners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.112688Z"},"links":{"cited_paper":"/paper/2212.04979","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:1d0c6108af1d37108730fcc93dafe2bd14ab3231354f195c522944f809465f20","observation_id":"f11a6134-c2e5-4735-9bcf-4d2ba70a9829","resolution":{"observed_at":"2026-08-12T15:06:05.112688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.803395Z","title":"Vid2seq: Large-scale pretraining of a vi- sual language model for dense video captioning","venue":null,"work_id":"1ab81561-bd3a-4e2e-8488-d04df9045036","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.117231Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:8bd0fdda98858a4faebc598a47d51541753c3f25683c5ba4c9b68e3a4882d968","observation_id":"4ea51806-a878-4d44-a798-21e8c1530627","resolution":{"observed_at":"2026-08-12T15:06:05.808297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.121604Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.121604Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:221b784d4666420e0d20f44c4b7092653a2d2574d485a5c0d987499d4a4b4814","observation_id":"f72021f7-070e-4aaa-8326-44b87f8ca744","resolution":{"observed_at":"2026-08-12T15:06:05.121604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.778450Z","title":"Hierarchical video-moment retrieval and step-captioning","venue":null,"work_id":"98bb2739-3777-47ca-b118-c05ff0d83e8e","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.126063Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:a83ebc7c48202bb0f3d589e77787c819b1f3f6b6061120b656f56c1d34b253b9","observation_id":"c5448c75-05e4-445e-9a98-1004fab46069","resolution":{"observed_at":"2026-08-12T15:06:05.783130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.763959Z","title":"Mer- lot: Multimodal neural script knowledge models","venue":null,"work_id":"b03f7fbf-a05f-4f73-b71f-4d0ca419e882","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.130393Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:a59b304b6580eae09a2f735b7d7bd113995935d36343e273e7f9c079e5e8f8fb","observation_id":"7cd6d66b-6d22-4bc3-8426-b728a86d9794","resolution":{"observed_at":"2026-08-12T15:06:05.768846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.749174Z","title":"Actionformer: Lo- calizing moments of actions with transformers","venue":null,"work_id":"e9b227fa-97e0-4e1c-94fc-f32c4523cfae","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.134742Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:ace61ad9c0511a3136db31df7e286c7223eb071d105df936c7e53e52755d2895","observation_id":"3c8c9704-693c-4510-a8dd-0692858bcee5","resolution":{"observed_at":"2026-08-12T15:06:05.754096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00529","last_updated":"2021-03-10T01:27:16Z","snapshot_observed_at":"2026-08-03T19:27:03.174412Z","submitted_at":"2021-01-02T23:35:27Z","title":"VinVL: Revisiting Visual Representations in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00529","snapshot_observed_at":"2026-08-12T15:06:05.139120Z","title":"Vinvl: Revisiting visual representations in vision-language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.139120Z"},"links":{"cited_paper":"/paper/2101.00529","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:90273ef1ba72f57422bb52fab46eb1400cffcc82989e82818b860f6c8a696e9a","observation_id":"3faccc33-6290-4dae-ad00-4adfd538343c","resolution":{"observed_at":"2026-08-12T15:06:05.139120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.733432Z","title":"Unifying event detec- tion and captioning as sequence generation via pre-training","venue":null,"work_id":"44d97d7a-4187-417f-aa7e-a62fc0abf5df","year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.143718Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:9199307d298e470bf785bfe251b088236e153bbdb28228fae17ae83cb209d23a","observation_id":"113ed232-ae2d-4a3c-bdd6-b7a0a89bc616","resolution":{"observed_at":"2026-08-12T15:06:05.738616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.718053Z","title":"Open-ended long-form video question answering via hierarchical convolutional self-attention networks","venue":null,"work_id":"18b8cb3a-ce53-42a1-ac14-bc14017bae81","year":2019},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.148081Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:6a81078321f25ea969a786bd34f4b7a037fd67c2d577972f46c2e55284075148","observation_id":"786bfcf7-53f3-4260-9b5d-ef716e770842","resolution":{"observed_at":"2026-08-12T15:06:05.722709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.703511Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"6eaa8498-a1ad-4775-a85c-8a5483aeba15","year":2018},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.152827Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:bd88c3cfe513c1bb01917a8f2c2c2fae31ce96932bbfde518974a6eb8b8430e5","observation_id":"d6f167a0-1b80-45b5-8251-af197a0a4cbf","resolution":{"observed_at":"2026-08-12T15:06:05.708283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.689025Z","title":"End-to-end dense video captioning with masked transformer","venue":null,"work_id":"d435c9d3-0f70-4826-b3c5-c301ae673165","year":2018},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.157215Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:c5d0e7df55b5ac8dc2c5b064d803666d7ebe435731c13e85cd93f110c11c585d","observation_id":"01ea6556-418e-491e-94a0-f39784588f12","resolution":{"observed_at":"2026-08-12T15:06:05.693993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.674450Z","title":"Streaming dense video captioning","venue":null,"work_id":"36dee465-ad62-47e7-bffd-b756bd94a858","year":2024},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.161886Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:41ddd9ad4f6d3e25576fda15c3c1aba0516077bde6db2930a754408bcd6eee9f","observation_id":"4b0e473b-4958-4e01-be53-f7d53ff8bc8b","resolution":{"observed_at":"2026-08-12T15:06:05.679149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03644","last_updated":"2020-10-07T20:45:14Z","snapshot_observed_at":"2026-08-15T11:50:10.086188Z","submitted_at":"2020-10-07T20:45:14Z","title":"Towards Understanding Sample Variance in Visually Grounded Language Generation: Evaluations and Observations","version":1},"cited_work":{"arxiv_id":"2010.03644","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.03644","snapshot_observed_at":"2026-08-12T15:06:05.208857Z","title":"Towards Understanding Sample Variance in Visually Grounded Language Generation: Evaluations and Observations","venue":"cs.CL","work_id":"ea49e53d-81ad-4040-8684-9d19d2312df6","year":2020},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.166374Z"},"links":{"cited_paper":"/paper/2010.03644","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:ba38a98791ccad162409e416556fa094d0da0227776a34bf1b4e3b56a2d8f5a3","observation_id":"981ea771-ddc3-4beb-b52f-4a1c4a08eb2e","resolution":{"observed_at":"2026-08-12T15:06:05.215806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.659586Z","title":"Thapliyal, William Yang Wang, and Radu Soricut","venue":null,"work_id":"33759d05-30d1-4621-b17b-4d9998d62f52","year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.171159Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:c10f35c46644f4bc7ef0780e77865e9c914add63f595cf08a8627c86629eb467","observation_id":"6919d268-601d-4346-ab9b-df06ec865e03","resolution":{"observed_at":"2026-08-12T15:06:05.664229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":4,"verified_fuzzy":47},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2411.14688."}