{"as_of":"2026-08-17T10:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:564cad1a57ba68c44540006e689f1d852c111aa1fb5a03ee862f31beb7c9b733","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T10:57:38.415005Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.10072/citation-record","integrity":"/paper/1908.10072/integrity","json":"/paper/1908.10072/citation-record.json","paper":"/paper/1908.10072"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.640956Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":"42e2c9e3-330f-44b3-98b8-0ff2aa4a2bd3","year":2005},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.041580Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:6e3c11a0a91f2f74eb972b275b9bceec1c2e7c8da96edb6eb0843c0be9379710","observation_id":"1873e6e7-db75-48f2-994e-6742a4b95208","resolution":{"observed_at":"2026-08-14T10:57:39.651622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.623594Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"1a0b1aa3-504b-4ce8-aee1-950108cf5be3","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.047580Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:2361282584358cf0d616846b3830caef00be564238e017eab8f9807cfd6a2dff","observation_id":"021b16e0-d146-4917-b487-dd4c5234eea9","resolution":{"observed_at":"2026-08-14T10:57:39.629639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.606539Z","title":"Collecting highly parallel data for paraphrase evaluation","venue":null,"work_id":"8644f86f-55d9-4361-9b25-aac0b9bc3f9a","year":2011},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.053330Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:8952131f14c6e645a382773128dc9559e2f332970761ec0b1405cf00dd2a2d91","observation_id":"c7d2996c-835a-41d4-ba78-3a57282b3503","resolution":{"observed_at":"2026-08-14T10:57:39.612282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.587753Z","title":"Video captioning with guidance of multimodal latent topics","venue":null,"work_id":"3a8fb844-1eb3-400b-9430-02aded5b9e8b","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.059178Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:1c79a72f1cb79acaad150fed0a1106b1321c521bb217c122f89c062856b44c7e","observation_id":"9df306c4-4e7e-4c5c-a4db-86ac34445603","resolution":{"observed_at":"2026-08-14T10:57:39.594185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.567836Z","title":"Motion guided spatial attention for video captioning","venue":null,"work_id":"c3aa51e0-0087-4458-bb69-ff36ebab1850","year":2019},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.064496Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:667fa1d9ffad220bd3ad99f83c3c49bd3b0ba49029aa7df8ab76c0dcd7bd00e7","observation_id":"41befd8a-49ea-4e0f-926d-ae5b944f8b9c","resolution":{"observed_at":"2026-08-14T10:57:39.573543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-14T10:57:38.069975Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.069975Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:a10f9775102420779b42ad2d474dd876bee12e970361ad9b859eca834d4aeca2","observation_id":"7de028ad-7c2e-4fde-a3a9-8c9e009071cb","resolution":{"observed_at":"2026-08-14T10:57:38.069975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.549480Z","title":"Regularizing rnns for caption generation by reconstructing the past with the present","venue":null,"work_id":"d3307853-135c-4122-a159-d0294ee14d1d","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.076492Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:f7a011b62e669333dc36b7ea003baced8bd1a13deafb494ee9062bbb4d103205","observation_id":"481f45ee-4ef8-412c-8145-ec313b212b6f","resolution":{"observed_at":"2026-08-14T10:57:39.554748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.532739Z","title":"Less is more: Picking informative frames for video captioning","venue":null,"work_id":"12874015-3890-4996-9970-80972cd9fb4f","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.081380Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:845fd8def058e203a38531cebc44e62f2437a3019a7c7327ecfa3b7ef7b60826","observation_id":"d75d3be0-b701-4797-88fd-00040d78ea1e","resolution":{"observed_at":"2026-08-14T10:57:39.538263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.515701Z","title":"Embodied question answering","venue":null,"work_id":"735ddd63-44f9-4140-8ce9-aa2ebfe78ca2","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.086671Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:4aa0057e627377d0d1b1dba45cd6dfe2f8d11dee83c222ab9043c5b2dade85df","observation_id":"34ce0a48-94d5-47ae-9fe5-34e52be0ad7d","resolution":{"observed_at":"2026-08-14T10:57:39.521481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.498478Z","title":"Diverse and controllable image captioning with part-of-speech guidance","venue":null,"work_id":"f05f5230-9273-42cd-815b-336e6fa8318c","year":2019},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.091702Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:622578fe96b4b4309b9e9cd3ba3d6bf52a6f296a179ca555cbce7ae25e66f4d1","observation_id":"cab863b8-345a-49e2-95ac-b02654e6a053","resolution":{"observed_at":"2026-08-14T10:57:39.504035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.481915Z","title":"Long-term recurrent convolutional networks for visual recognition and description","venue":null,"work_id":"c86af19e-43c9-460f-a3e7-084482d0af3e","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.099165Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:75bf5df4f1fbd31ebd6e9955c7a35f5b1526d7f56bf5b2caf637aad983cdb872","observation_id":"2c82ff3d-679d-4f8d-ba5a-e0381c22deb6","resolution":{"observed_at":"2026-08-14T10:57:39.487390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.463271Z","title":"Unsupervised image captioning","venue":null,"work_id":"1a9442d5-8841-4520-89e6-8c855b328b71","year":2019},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.104751Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:c6b4dca931eb74529ecd835c8fa1f38c3b580ba40736775fadf44098047fb3cf","observation_id":"f8fd452f-6470-4535-bc1a-c6e806eb8b79","resolution":{"observed_at":"2026-08-14T10:57:39.468755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.445443Z","title":"Multimodal compact bilinear pooling for visual question answering and visual grounding","venue":null,"work_id":"c1c6cc1f-94b7-4b7d-a2cc-d32fc03260d1","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.109755Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:385fec93108c0707dcbea748d8af41966e81827ee7bfe065c2be203e54bb7385","observation_id":"5091e6f7-4a65-40e0-ab93-8ad3849c18b5","resolution":{"observed_at":"2026-08-14T10:57:39.450592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.427844Z","title":"Semantic compositional networks for visual captioning","venue":null,"work_id":"5807bf04-b2cd-42f8-9c0c-3490487e64f5","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.115264Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:1bd99221f94a21dc55a38abaeb18078bc9e2fd943ac15ce7226b2390ecf81c09","observation_id":"4df725c0-297e-43d6-b786-a5bca031cd73","resolution":{"observed_at":"2026-08-14T10:57:39.433743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.407497Z","title":"Youtube2text: Recognizing and describing arbitrary activities using semantic hierarchies and zero-shot recognition","venue":null,"work_id":"55fc4d24-d6d3-4a68-b677-5c1aaa7f9388","year":2013},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.121213Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:fd4a1e27d697e68bd0dbd9ed14dbee740bf8d80dbe6b8406bde38ce54fa402bb","observation_id":"5f1b3ffe-4ac0-4288-9a15-f6affc13d424","resolution":{"observed_at":"2026-08-14T10:57:39.414528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.386878Z","title":"Image caption generation with part of speech guidance","venue":null,"work_id":"cc765454-f93d-45ba-a4be-7eaea3731976","year":2019},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.126470Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:8a24f45d0446ef4eff371e1d34ec84c6c17faf8196e36d6ac8aacbbcdc7fcbfa","observation_id":"3a93c80b-12b3-45ec-86a7-4ca44ba535a6","resolution":{"observed_at":"2026-08-14T10:57:39.392423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.367549Z","title":"Recurrent fusion network for image captioning","venue":null,"work_id":"20eab0b8-69fa-4d40-977f-3f7d6ca67499","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.131519Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:62e56c194ed134bcf788b9d5084e2e9d54902bd1599c4dab70866edc78353335","observation_id":"d137cd4b-5e2f-46a4-b370-e29aa33a6ecd","resolution":{"observed_at":"2026-08-14T10:57:39.373534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.349176Z","title":"Describing videos using multi-modal fusion","venue":null,"work_id":"2e48dbb1-6edd-4538-8118-72e43b1a2e39","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.137521Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:8948e924c176f100eff7e1e774147406d55556befa9061c1832ee86b85954c3b","observation_id":"37133a6b-b580-46ff-9cf8-4f59c9d78d39","resolution":{"observed_at":"2026-08-14T10:57:39.354958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-14T10:57:38.143226Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.143226Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:984b2bf73459e726a9e36fa181cbe4d5b6fd170fb5214d2a5cfea72517397746","observation_id":"b11ab0e7-a50b-4e99-af94-a08eca01a820","resolution":{"observed_at":"2026-08-14T10:57:38.143226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.331786Z","title":"Hadamard product for low-rank bilinear pooling","venue":null,"work_id":"8f717dd8-6158-4dd3-941d-66511879f7b2","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.151471Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:b30076a31d687d57cbab8927defdb1bf41e4b8f5d998fae39d1b375d791eadfb","observation_id":"c7fcec0e-8678-4bc7-ae8b-d7fee8afe461","resolution":{"observed_at":"2026-08-14T10:57:39.337697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.311892Z","title":"Natural language description of human activities from video images based on concept hierarchy of actions","venue":null,"work_id":"e98fe796-94c9-4d49-894f-927b9c7fadf1","year":2002},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.157564Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:3bc2c8e444d8069a7f526f8a8461e62147b89cd17bd03695c82901d020426e5e","observation_id":"fd5448d2-06ec-4839-94be-8a646803e163","resolution":{"observed_at":"2026-08-14T10:57:39.319316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.168749Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.168749Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:f33f6c628e8f4e4c5edb9fbda9b444fb4445f7464ee1fb33317b102481c5de44","observation_id":"5baa7aad-7032-48e8-aa80-26f5f6fc6183","resolution":{"observed_at":"2026-08-14T10:57:38.168749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.273043Z","title":"Sibnet: Sibling convolutional encoder for video captioning","venue":null,"work_id":"1e125d49-161d-4686-a447-abd3f76ec0c7","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.176170Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:7f3e0a72ebb9df6dddaba7cae5685c8d585ca95c8fdfb9816b4eee4e25745ff6","observation_id":"d6ffe39b-b72a-4915-8561-e5da7eb56eaf","resolution":{"observed_at":"2026-08-14T10:57:39.279723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.255513Z","title":"Matching image and sentence with multi-faceted representations","venue":null,"work_id":"8f030e4d-7ab9-4ec8-8aa7-3580d2b268ac","year":2019},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.181550Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:1a846fbb8c68b78dbdcbb72e601d9f32215b29584d75c3bf8c98f1e50d83ec64","observation_id":"1bc14e2a-7463-42a6-a223-3813c20f5cce","resolution":{"observed_at":"2026-08-14T10:57:39.260563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.239058Z","title":"Learning to answer questions from image using convolutional neural network","venue":null,"work_id":"ee537a93-63d8-4072-b8c8-a5db26fe8d9d","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.186885Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:9c53cf24b820d0d542758e0fdc207409d9be1aa74df3feafec0962e0786956ac","observation_id":"700d4d2c-c917-4829-bd71-ea8df1bb4df0","resolution":{"observed_at":"2026-08-14T10:57:39.244241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.222547Z","title":"Multimodal convolutional neural networks for matching image and sentence","venue":null,"work_id":"ab20f352-536b-4a8b-8a16-3b05268ca62d","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.192462Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:b38f4d3cceb3075e4c0e4a1c4eaa2dd0873f74cfda233cb18a00ee11b447b766","observation_id":"9a572c67-6bea-4cd4-be14-2846aa3b6a65","resolution":{"observed_at":"2026-08-14T10:57:39.227761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.205535Z","title":"Jointly modeling embedding and translation to bridge video and language","venue":null,"work_id":"1b661b8e-a290-4974-8645-38c91ff8f539","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.198856Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:48e793bd9a795957d65c3ff9d041d125c47327e7242e4ede4cf1e3330d5702d2","observation_id":"c9dae1cb-c071-497e-8df2-ade0bfbab609","resolution":{"observed_at":"2026-08-14T10:57:39.211142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.187678Z","title":"Video captioning with transferred semantic attributes","venue":null,"work_id":"8117ddf3-b5b1-40be-9d52-83a20a163c5e","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.204428Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:06eb70cb2efa4c9147c27f4b6d0d92d317ad16ca8d37644988d530a6247995cf","observation_id":"c5c7377c-0eea-44d0-9384-882e23422678","resolution":{"observed_at":"2026-08-14T10:57:39.192777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.171641Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"1ca50e32-a025-4b67-951a-abb460e90761","year":2002},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.209681Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:fed13bb3a74a8e470dc55a8bb1c2c6d39eef99ecf58efe136d68f268c010b412","observation_id":"17f6b06a-f575-46f8-9748-75a7407ac00d","resolution":{"observed_at":"2026-08-14T10:57:39.176958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.154543Z","title":"Tv-l1 optical flow estimation","venue":null,"work_id":"646d1ce7-d9b1-4609-ba9f-bfc18adf7867","year":2013},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.215643Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:dbf5b48e396bc7739f94b17b4e97eace68957df9bff3e70e3310ecc123244603","observation_id":"d16035c1-df84-4eb6-9130-bbee5849f4fc","resolution":{"observed_at":"2026-08-14T10:57:39.159957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.138047Z","title":"Multimodal video description","venue":null,"work_id":"6c5b5e46-7b9f-4661-87fd-8965123243ef","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.220829Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:d8448f1cb42fd0cd0325d637775ee553f3e3f644e8c6c8c0106e8183a6341b7d","observation_id":"1f5c2d93-c0ba-4599-8f61-dec9b559090e","resolution":{"observed_at":"2026-08-14T10:57:39.143375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.120816Z","title":"Self-critical sequence training for image captioning","venue":null,"work_id":"177ada68-c481-4b22-9578-499aba87e990","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.226951Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:9e7d71e06460b49825d8ac93d4d26e08c5bfa9ede703282dd4928547942b13ca","observation_id":"125438e3-74ba-4c9c-a42c-ed07a30c43a5","resolution":{"observed_at":"2026-08-14T10:57:39.126286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.103666Z","title":"Coherent multi-sentence video description with variable level of detail","venue":null,"work_id":"4d01027b-6d61-4735-b31a-5d8e72aeb578","year":2014},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.232533Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:6829494db32c3717066f64e28990cae3ff0948bd9024ad2493cfc36c63900a71","observation_id":"0a6eba4c-8f05-4e06-99ed-98f2b8e01e39","resolution":{"observed_at":"2026-08-14T10:57:39.108828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.087737Z","title":"Translating video content to natural language descriptions","venue":null,"work_id":"cbfdf043-1c00-46eb-b081-e59631a7eab9","year":2013},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.238054Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:4a40b7a00b7b1c634d6422d24d6ed3e43cb8550bfd64ee6519f9f8df810f6fb1","observation_id":"25f0ed17-dd4c-440b-b6ac-b34f75bacfd9","resolution":{"observed_at":"2026-08-14T10:57:39.093009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.070415Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":"09fab800-b9c1-4d0a-8511-a044c8028bb5","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.246095Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:f78ea62861167437e7d4068afc7394b438de083a2dc9af7d5e0ef562409a4034","observation_id":"1bb049a4-948f-4de3-8b78-667998310f40","resolution":{"observed_at":"2026-08-14T10:57:39.075893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.052492Z","title":"Frame-and segment-level features and candidate pool evaluation for video caption generation","venue":null,"work_id":"aba1e133-a1cd-4a87-9721-93c0d6f8b551","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.252404Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:c0212a93c5574df1b905ce7f8f79411220c5e3f6643f207e61b905320ffd5fd3","observation_id":"5d73ab8b-b969-4a39-a3b5-52386a26d2d1","resolution":{"observed_at":"2026-08-14T10:57:39.058047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.033784Z","title":"Quantization-based hashing: a general framework for scalable image and video retrieval","venue":null,"work_id":"2401f6de-1735-4750-9da4-d434e5e3b3ac","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.258742Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:be06c5722aa23163a9e30e2332b214672017735e9f6b738400cecb46413152ef","observation_id":"c7427a89-25d2-4d56-ac26-5c1b8981e5b1","resolution":{"observed_at":"2026-08-14T10:57:39.039809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.016439Z","title":"Inception-v4, inception-resnet and the impact of residual connections on learning","venue":null,"work_id":"6490f64c-79f8-4e2a-ba9d-29f1c7704934","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.265410Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:71df31b172d179487ebd7844f2f913c6fe3f8ef867c2b1080b4e282f079b017f","observation_id":"328ed9a7-2499-4e16-8773-4450a66adadf","resolution":{"observed_at":"2026-08-14T10:57:39.022436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.997676Z","title":"Feature-rich part-of-speech tagging with a cyclic dependency network","venue":null,"work_id":"b1cab2cf-a3e1-41b3-950d-e651f9096154","year":2003},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.272559Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:d12e6b6e84365a1991bdf098f67c83504a0a5c54010f78969f17ebf63427a7f6","observation_id":"a8ef05c7-5dff-4789-9594-33bf05158b2c","resolution":{"observed_at":"2026-08-14T10:57:39.003880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.973650Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":"a089365c-1117-437b-a8ef-a423cce5ebd4","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.279403Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:f166c8ea58c373c40451ce95bc40da28dcd52fd17abb63921e652459074a9a83","observation_id":"f73729ed-960a-4aea-9987-e82694235fea","resolution":{"observed_at":"2026-08-14T10:57:38.981064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.951849Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":"ade343f1-1cfe-4d0e-b50f-72ff711e0f20","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.284378Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:be065fe84ab0332958a5d04da346a09f77a2589f6a9a5c8ab50cb501a888540c","observation_id":"9e318745-2eb7-46a5-bc12-d5c4a9cc3744","resolution":{"observed_at":"2026-08-14T10:57:38.957250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.934843Z","title":"Sequence to sequence-video to text","venue":null,"work_id":"60bfa51a-fbeb-4a77-8865-988c5a5b50d7","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.290185Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:7274a8257187f7b9e4851c3413771b5d0e6792a9ab367d3aadad19da09c00e63","observation_id":"c4fb9dbb-b469-4a6e-a081-6a7517c5fc11","resolution":{"observed_at":"2026-08-14T10:57:38.940058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.914825Z","title":"Translating videos to natural language using deep recurrent neural networks","venue":null,"work_id":"bed00a3f-9e54-499e-8762-bb4b2e37200a","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.297238Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:6c6bb1d39724544c7e8f1374715ff2f03f6fd7c512ae4bb04e588269c26f9a20","observation_id":"e5e326db-5329-435d-8d2e-2e5f3a6da194","resolution":{"observed_at":"2026-08-14T10:57:38.921555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.891996Z","title":"Hierarchical photo-scene encoder for album storytelling","venue":null,"work_id":"ace843e7-6928-4d0c-8ff1-7def749d9c09","year":2019},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.303765Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:3ac5daf8023f7af7e6e1eab67a78dc4d39685e426187e53116a0a994789050bd","observation_id":"408adeae-2df5-4cde-994f-197dd7e1f8e2","resolution":{"observed_at":"2026-08-14T10:57:38.898224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.873236Z","title":"Reconstruction network for video captioning","venue":null,"work_id":"3fc5d526-5096-4cac-a3dc-35b73addf165","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.309023Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:41e3dcff4acd90a8639091150b4c2bc0a925ba6de9e4475aaf6251eb84c62d84","observation_id":"c28207be-6357-408c-9aee-dd507a4f322e","resolution":{"observed_at":"2026-08-14T10:57:38.879932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.854917Z","title":"Bidirectional attentive fusion with context gating for dense video captioning","venue":null,"work_id":"beec9b10-6dd1-4a60-bc69-bd2c33ed369b","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.314056Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:dd4e4419a79a0ee99eb7823dc4f279a46ef410481d9458fb25245ff9ec64f927","observation_id":"0da1353e-262b-4929-8318-89f3cf4832e4","resolution":{"observed_at":"2026-08-14T10:57:38.861169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.838054Z","title":"M3: Multimodal memory modelling for video captioning","venue":null,"work_id":"427dbe3c-0b49-434f-bc68-8c6d41b8adc6","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.319099Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:599ec8a5fe15560651b9bdcdcfaf96b6235b6205058d760b027299440c37a6fa","observation_id":"fb9e6b81-abac-4d4c-b220-38e3d1fa02fa","resolution":{"observed_at":"2026-08-14T10:57:38.843411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.819610Z","title":"A survey on learning to hash","venue":null,"work_id":"ca6f7837-ba3f-4acf-9864-827b5d822233","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.324097Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:5ed416934b79d1ca99a5e09ab6207fc5360f064bfc739fc46a121dff8ddabd09","observation_id":"f54d4121-39f4-4b6a-8d35-7ff8fae36104","resolution":{"observed_at":"2026-08-14T10:57:38.825218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.801481Z","title":"Interpretable video captioning via trajectory structured localization","venue":null,"work_id":"055f9459-0ace-45ad-b4ed-d598579aecb5","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.329406Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:bf595a25a15266e03753d50a9ba7be21c8a9c28c14d5771edf1eb7a5e202e248","observation_id":"8a66c135-e4c8-4d55-b55b-1cd98878b26f","resolution":{"observed_at":"2026-08-14T10:57:38.807467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.781743Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"cfa789b5-9737-4ca1-b4a4-7556c5625b89","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.334432Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:a43ddc5382fb085254fa900d9dba586b06312d363b5307c959d7c7d8d0a0c527","observation_id":"28b260c5-3bdc-4cb1-abaa-56167eece4f1","resolution":{"observed_at":"2026-08-14T10:57:38.788354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.759594Z","title":"Learning multimodal attention lstm networks for video captioning","venue":null,"work_id":"3c7ba337-b592-4f55-9c12-35866d82d21b","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.339586Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:d4823cb0e20d903376f92c565662fcc9163d1442a3ab59b3a1b287dbfd119585","observation_id":"50162c04-e9e6-4aa3-85f5-32c46c1ffb3d","resolution":{"observed_at":"2026-08-14T10:57:38.765691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.738714Z","title":"Jointly modeling deep video and compositional text to bridge vision and language in a unified framework","venue":null,"work_id":"958de083-7537-4519-8043-924eb16306ce","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.345161Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:1ede98126cd8e0753d7eb05cd0cf8ae3f8943f5454dec9852a839a34357988f5","observation_id":"3f0aaf19-3837-458e-9e34-87f77d321aa7","resolution":{"observed_at":"2026-08-14T10:57:38.746357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.718650Z","title":"Describing videos by exploiting temporal structure","venue":null,"work_id":"d03c87ff-bde5-4580-a657-04b21969c342","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.354088Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:b3685441be8187b72ddba1993bb888039f1eaa7b4e1cba88e641fcfc1d9f76e3","observation_id":"658ae573-f81c-4559-bda4-e7e81f1d461b","resolution":{"observed_at":"2026-08-14T10:57:38.724518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.694749Z","title":"Video paragraph captioning using hierarchical recurrent neural networks","venue":null,"work_id":"16ba69a2-9d1f-4a15-9531-f4b72efee7ca","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.360033Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:187760ce3d5ad2c3d642e880c75a525fede4b24bac6561acbb886317f0a1ca52","observation_id":"a010624a-10c4-45f7-b188-3f0f6482ef5b","resolution":{"observed_at":"2026-08-14T10:57:38.703201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.5701","last_updated":"2012-12-22T15:46:49Z","snapshot_observed_at":"2026-08-15T00:34:41.793608Z","submitted_at":"2012-12-22T15:46:49Z","title":"ADADELTA: An Adaptive Learning Rate Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.5701","snapshot_observed_at":"2026-08-14T10:57:38.365230Z","title":"Adadelta: an adaptive learning rate method","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.365230Z"},"links":{"cited_paper":"/paper/1212.5701","citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:97a7563ec9440b8d28d682e2b015991fcb87d602060007ac35f7d7c53db18a35","observation_id":"efd89af8-df75-4e7f-b627-91de1c30eefc","resolution":{"observed_at":"2026-08-14T10:57:38.365230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.673293Z","title":"Reconstruct and represent video contents for captioning via reinforcement learning","venue":null,"work_id":"c09e9881-7f76-4f8b-baae-0a2fecd46f8b","year":2019},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.371492Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:7ea7ca87c48af31d405afd236f3c450b26b4dee2e171f64e2e99634ead4a5386","observation_id":"4296d482-517e-4e48-964d-212286737a98","resolution":{"observed_at":"2026-08-14T10:57:38.680241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.650869Z","title":null,"venue":null,"work_id":"adf60889-fba7-434b-840a-3d7b6bff2fe3","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.376450Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:d0f4a81a1913eb8fb51e7eec6f2fb10eeb01aee9609953dbce513289a271ab0c","observation_id":"cab27f6e-071f-41d5-9e55-f7c21fd2b2b2","resolution":{"observed_at":"2026-08-14T10:57:38.656895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02300","last_updated":"2017-08-07T20:50:24Z","snapshot_observed_at":"2026-08-14T20:42:41.722907Z","submitted_at":"2017-08-07T20:50:24Z","title":"Reinforced Video Captioning with Entailment Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02300","snapshot_observed_at":"2026-08-14T10:57:38.381673Z","title":"Pasunuru and M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.381673Z"},"links":{"cited_paper":"/paper/1708.02300","citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:217b4952a05c2cac2de7be11f6b7723d544eb0959f09207ec7af90d8b7475c0f","observation_id":"9575ebe7-20b6-4b41-90cd-6d53b600021d","resolution":{"observed_at":"2026-08-14T10:57:38.381673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.630877Z","title":null,"venue":null,"work_id":"f3396b91-e553-47f4-be8a-e87c7fa33455","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.387488Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:4171bdfca6ee20b423e058c8fda6c20e1c3cb7025b3760a407ec1566456b9f1d","observation_id":"18fdd141-200f-401e-9a10-76be6874bb12","resolution":{"observed_at":"2026-08-14T10:57:38.636429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.612873Z","title":null,"venue":null,"work_id":"b4274d2a-5abe-4ff6-bb29-412dda47144c","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.393036Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:fa4d8ceb4a261d269eb5486e52001c5f845e9188b32c7d6279db95a1ba155448","observation_id":"71e4be24-20f1-4bf1-aaba-8833c9e222e4","resolution":{"observed_at":"2026-08-14T10:57:38.618714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.595243Z","title":null,"venue":null,"work_id":"6946aa0b-4ddb-41d6-9820-5f7debad602e","year":1998},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.398564Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:331a4e98e6bf541b8b8d09b6c0623d973011000a16511921da2a190066d1c2a3","observation_id":"5d62de1a-c435-4887-85d2-63b8ad041f82","resolution":{"observed_at":"2026-08-14T10:57:38.600523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.576260Z","title":"Vedantam, C","venue":null,"work_id":"e52de301-d17f-4582-a014-acdfead001a1","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.404074Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:81476a784c27a7b9dcb46190ca602e8fd7f853963ab3835db8a27e2cd0e77685","observation_id":"c8db4f33-38ba-4b64-afa1-e2ab34ba190f","resolution":{"observed_at":"2026-08-14T10:57:38.582150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.554250Z","title":null,"venue":null,"work_id":"542f9dd3-8e11-4b94-8ef8-ecfb3a865231","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.409600Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:e8ea267611abf0992bfede32534e9c3403e35fc630c08f1fa9e8047d6bb95609","observation_id":"5a5ab054-33a5-47b3-a10b-26015aab2806","resolution":{"observed_at":"2026-08-14T10:57:38.561785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.00521","last_updated":"2016-01-12T06:35:48Z","snapshot_observed_at":"2026-08-14T22:50:02.553800Z","submitted_at":"2015-05-04T04:14:54Z","title":"Reinforcement Learning Neural Turing Machines - Revised","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.00521","snapshot_observed_at":"2026-08-14T10:57:38.415005Z","title":"Zaremba and I","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.415005Z"},"links":{"cited_paper":"/paper/1505.00521","citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:9d0084c4b01206a8026b1bb90a82c650ced75fd6e55670fa5e2e833f7e8a3a6a","observation_id":"37f52123-9752-4d5d-9975-2604d131c8bb","resolution":{"observed_at":"2026-08-14T10:57:38.415005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T10:51:12.795338Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:1908.10072."}