{"as_of":"2026-08-16T01:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:149274c9764a0567ad9ef2ee26832107d0fcd98d08f244078330df4e8591026f","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T10:10:25.592243Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.11824/citation-record","integrity":"/paper/1908.11824/integrity","json":"/paper/1908.11824/citation-record.json","paper":"/paper/1908.11824"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.260532Z","title":"Spice: Semantic propositional image cap- tion evaluation","venue":null,"work_id":"86a8e9c4-d33a-444f-af5a-6e9cbc1be0a2","year":2016},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.392341Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:15a0e2bbfe59fbcfd23d6b492350ac0c55b474a1b1f4c45889f20c957fc14d3f","observation_id":"29bd4b2c-1829-43c8-848f-35f1486d450a","resolution":{"observed_at":"2026-08-14T10:10:26.264741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.247484Z","title":"Bottom-up and top-down attention for image captioning and vqa","venue":null,"work_id":"8fbfe185-b81c-41db-a89c-05f74f3fc661","year":2018},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.397233Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:83e640d561eb493d386c3c05712bb398aca108b5d85f60ffc97545487c8fad5b","observation_id":"e243d4fe-ef2a-4d62-9904-f4ff1ad39fd4","resolution":{"observed_at":"2026-08-14T10:10:26.252146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.232727Z","title":"Top-down versus bottom-up control of attention in the prefrontal and posterior parietal cortices","venue":null,"work_id":"fd873854-69a6-440d-8b49-8fd59b48e61e","year":2007},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.401486Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:fbb790c9965ccd9a4cb70b84e0a666a0629c7180a6a48e51605f3b107104cdbc","observation_id":"384d1a27-b676-4838-a94d-1a244be2b565","resolution":{"observed_at":"2026-08-14T10:10:26.238860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-14T10:10:25.405599Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.405599Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:035fe56b84c0e3806e508a019668e5ea70096efd6884eee5de01b82242ba5ae8","observation_id":"e8059557-8856-4156-bb5d-c57275615407","resolution":{"observed_at":"2026-08-14T10:10:25.405599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.219901Z","title":"Mind’s eye: A recur- rent visual representation for image caption generation","venue":null,"work_id":"632169e9-e39e-40a7-b13f-aa638190b604","year":2015},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.409827Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:9d120b8fa854c6f57d80ccbcf21300f1c03d33b7f36f5bd345d9178ad6b45a27","observation_id":"90079b25-9863-47a5-bee5-3b2679b86a24","resolution":{"observed_at":"2026-08-14T10:10:26.224548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.206196Z","title":"Regularizing rnns for caption generation by reconstruct- ing the past with the present","venue":null,"work_id":"d2a1b051-d9d4-41a2-816d-c614d43bd225","year":2018},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.413623Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:a3081441f83e861b4b510dd34515245b14eb2ddfda012f5780dd782b4b5c7038","observation_id":"504283d4-82c1-4a42-b370-9b53548d1d59","resolution":{"observed_at":"2026-08-14T10:10:26.210593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.1078","last_updated":"2014-09-03T00:25:02Z","snapshot_observed_at":"2026-08-15T13:36:27.756066Z","submitted_at":"2014-06-03T17:47:08Z","title":"Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.1078","snapshot_observed_at":"2026-08-14T10:10:25.417627Z","title":"Learning phrase representations using rnn encoder-decoder for statistical machine translation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.417627Z"},"links":{"cited_paper":"/paper/1406.1078","citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:d44da44746e143f60c7508b9720adeed1651eadeec1f4a6624c3f6e128e95480","observation_id":"5f56673d-9986-43f8-a3de-40a90397f7ad","resolution":{"observed_at":"2026-08-14T10:10:25.417627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.192814Z","title":"Meteor universal: Lan- guage speciﬁc translation evaluation for any target language","venue":null,"work_id":"05c2b243-a1c3-4d60-bb3d-eff9855af3b4","year":2014},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.421445Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:22e5c4a9ad4300b5d5327aa48577bd3a59d8b6b7ee8269ebb38bd24cb2d159cb","observation_id":"d6129874-1e3f-4e6c-a081-7507135aac62","resolution":{"observed_at":"2026-08-14T10:10:26.197190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.01809","last_updated":"2015-10-14T22:03:40Z","snapshot_observed_at":"2026-08-14T22:49:27.276564Z","submitted_at":"2015-05-07T18:36:14Z","title":"Language Models for Image Captioning: The Quirks and What Works","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.01809","snapshot_observed_at":"2026-08-14T10:10:25.425670Z","title":"Language models for image captioning: The quirks and what works","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.425670Z"},"links":{"cited_paper":"/paper/1505.01809","citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:c085254b6c37e60bef5ebd65995060e48b5f0fc48df2e2ca3e8958e861d3c2d7","observation_id":"18b5eef7-c94d-4c94-82fd-0999ed52b0b6","resolution":{"observed_at":"2026-08-14T10:10:25.425670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.179159Z","title":"Long-term recurrent convolutional net- works for visual recognition and description","venue":null,"work_id":"1efb8f8f-3101-448b-a3d5-2b8579dca325","year":2015},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.430074Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:8a6b658ae99bafec1c52bc75ca0c677564ac29fdf633cc3196824332b0066f1d","observation_id":"e9b5babe-ede2-4720-9ebf-ac405796aa77","resolution":{"observed_at":"2026-08-14T10:10:26.184139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03122","last_updated":"2017-07-25T01:40:57Z","snapshot_observed_at":"2026-08-14T21:02:01.058213Z","submitted_at":"2017-05-08T23:25:30Z","title":"Convolutional Sequence to Sequence Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03122","snapshot_observed_at":"2026-08-14T10:10:25.433795Z","title":"Convolutional sequence to sequence learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.433795Z"},"links":{"cited_paper":"/paper/1705.03122","citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:443eab0d69a10942c4df50e0a29be1667040ef053105652bea05ca8cca30d754","observation_id":"e6acdb79-da10-4bad-b75a-111b3cb4f1d3","resolution":{"observed_at":"2026-08-14T10:10:25.433795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.166198Z","title":"Spatial pyramid pooling in deep convolutional networks for visual recognition","venue":null,"work_id":"978101a4-d9d8-4977-8492-120f1d7adddd","year":2014},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.438309Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:02b89f2dcaaeb4867ed237ce08052816c1bb1102d9e660f12e305fd35426d783","observation_id":"2758cb43-2c9d-4b79-8e5e-57d5958c509d","resolution":{"observed_at":"2026-08-14T10:10:26.170118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.442066Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.442066Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:6a7418ebbe24e24dcaede062c79d60fa057c8e92237ebb48e62e2d0b5479c2ff","observation_id":"76b43b1d-b5ca-4a79-84bb-4888de938989","resolution":{"observed_at":"2026-08-14T10:10:25.442066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.446021Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.446021Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:980a792c8fcc6e950a7531bd1c188e998da3be2668e400c6b6dcd11f47d0f691","observation_id":"e8ec4058-ffd1-4092-b53c-b211e9de8fdc","resolution":{"observed_at":"2026-08-14T10:10:25.446021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.138085Z","title":"Densely connected convolutional net- works","venue":null,"work_id":"19378749-1ea8-44a6-b6b9-6a0168ca69f2","year":2017},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.450395Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:e840bf8f83212b40661db590d9970bd9996b8767cf5cf69f5e5564d7f1937f4d","observation_id":"5e3ef1b2-e10f-406a-8c0a-b881ba112dd2","resolution":{"observed_at":"2026-08-14T10:10:26.142521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.125120Z","title":"Caffe: Convolutional architecture for fast feature embedding","venue":null,"work_id":"81c7e36b-f098-48c3-b412-3b00d1da289c","year":2014},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.454781Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:34a64dcc2ae5da8b74d52bb319725e7694e2a8cadb9259bda123e356eb8aa7d8","observation_id":"dd76274a-6442-4f9a-bbc2-40b18fe93e6d","resolution":{"observed_at":"2026-08-14T10:10:26.129283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.111511Z","title":"Recurrent fusion network for image captioning","venue":null,"work_id":"047af984-e9ed-41de-9021-4240cd0fc5a6","year":2018},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.458726Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:e5c99f9544d33067b5a9cc3a5abf113d08768bcf26676bafcff83af95e748dff","observation_id":"0d6f131f-9c9b-4da2-93c3-36fdb5226c74","resolution":{"observed_at":"2026-08-14T10:10:26.116307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.462512Z","title":"Deep visual-semantic align- ments for generating image descriptions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.462512Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:fb1c616ba4ac200c6c5f50c4e3457d12ac1a7cf022f1e6e7c896815a00df0d11","observation_id":"6e8be93d-fb3b-4b91-9e68-911cde583a93","resolution":{"observed_at":"2026-08-14T10:10:25.462512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.466376Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.466376Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:0952540d5210e4f096430d946b9084d0c8ebaeb095f1103e94baa9d9b062bb83","observation_id":"98f5b058-b0e0-4137-b6aa-9e55b9bbf2cf","resolution":{"observed_at":"2026-08-14T10:10:25.466376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.080092Z","title":"Imagenet classiﬁcation with deep convolutional neural net- works","venue":null,"work_id":"b76cc0bd-6dd2-4aa4-a3a8-22332c6c2d68","year":2012},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.470407Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:7aad6ba74d8836f038cd1d6a0db6a326d7563e527ef32020e03e6e94fedaf199","observation_id":"adfd4cfa-ec50-426c-a281-f09d4286c66c","resolution":{"observed_at":"2026-08-14T10:10:26.085189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.065828Z","title":"Babytalk: Understanding and generating simple image descriptions","venue":null,"work_id":"57a5b7e4-93ac-4627-90e1-64323fa8b9b9","year":2013},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.474035Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:d7eb3111609a9328f65188403cfa0a55a0d127d9b11ffb6160923c764aedf897","observation_id":"c7440bec-0da8-4ec1-9925-5b6bfa171c40","resolution":{"observed_at":"2026-08-14T10:10:26.070659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.052957Z","title":"Professor forcing: A new algorithm for training recurrent networks","venue":null,"work_id":"8e1b6518-927f-4d48-ac88-1433b43f6172","year":2016},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.478014Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:ecb03ccae6cc12962f67150214746b66e65d36427e2dfc9130b26eb3a7853073","observation_id":"4d2766e4-9e15-43ea-a06f-e8e6f36a64f9","resolution":{"observed_at":"2026-08-14T10:10:26.057412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.039908Z","title":"Towards total scene understanding: Classiﬁcation, annotation and segmen- tation in an automatic framework","venue":null,"work_id":"a05d4a6c-8946-4e62-9db9-45e4da8ad73f","year":2009},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.482164Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:80d053d088fddd74422a723deba718f71cb5a52d24bb44c7fde76ad1eacd0373","observation_id":"00294979-5e76-4c81-ba74-cce7a2a59284","resolution":{"observed_at":"2026-08-14T10:10:26.044221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.027001Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"f605bfa6-5586-40ff-9d83-d4f4c9f3b40b","year":2004},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.485780Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:931d03711ef68ba8741bf17d029f31eb0f410a69186dcaa6c6104c590e7750af","observation_id":"d316fec5-49b7-4668-9e04-c5fcc2a9cfe9","resolution":{"observed_at":"2026-08-14T10:10:26.031699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00370","last_updated":"2018-03-12T18:53:06Z","snapshot_observed_at":"2026-08-14T21:27:34.361390Z","submitted_at":"2016-12-01T18:10:48Z","title":"Improved Image Captioning via Policy Gradient optimization of SPIDEr","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.00370","snapshot_observed_at":"2026-08-14T10:10:25.489464Z","title":"Optimization of image description met- rics using policy gradient methods","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.489464Z"},"links":{"cited_paper":"/paper/1612.00370","citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:2f5701572c51581f379823a44ae29e919d2bf0bdaa4ea09680cdbdb9bb674aca","observation_id":"bfb55628-469a-4437-918f-e5b2ec3e9eca","resolution":{"observed_at":"2026-08-14T10:10:25.489464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:26.013026Z","title":"Knowing when to look: Adaptive attention via a visual sen- tinel for image captioning","venue":null,"work_id":"7db09269-a515-43bb-8ea4-dcb5a6a26c27","year":2017},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.493512Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:a58f7700ecc968899b9ea46b35ef2819905f47c7b0c7f962dcea7ad1e76d41a0","observation_id":"c7114824-a476-47e1-b828-2a5789360a08","resolution":{"observed_at":"2026-08-14T10:10:26.017756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.997402Z","title":"Hierarchical question-image co-attention for visual question answering","venue":null,"work_id":"864f72ab-4d1b-45e5-ac37-c1d562801ff5","year":2016},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.496860Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:870417c43a31d79772e8adfc355ccfd0184e76155c00907e4642a9b0a14a86b0","observation_id":"d195b101-9e01-42c4-be0e-087163c96dba","resolution":{"observed_at":"2026-08-14T10:10:26.003251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.982018Z","title":"Neural baby talk","venue":null,"work_id":"8a0cb38d-2784-40fd-9218-98ab6b97e6a1","year":2018},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.500887Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:d2ac78e7ab1a27f5da7de84f603e642e64d5a78ac8a29e50df84dbb9185399e8","observation_id":"118f4c6f-8e74-499f-b743-f4695ca5977f","resolution":{"observed_at":"2026-08-14T10:10:25.987571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.968530Z","title":"Coherent dialogue with attention-based language models","venue":null,"work_id":"50fedfd1-594f-4cac-904e-bb19222d97bf","year":2017},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.504598Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:528efa362973d1cb807f72fb5a768dabc8ff1a0b552345631513826a56dbabee","observation_id":"990a286c-a581-4a3a-9440-e29cbedfb6eb","resolution":{"observed_at":"2026-08-14T10:10:25.973392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.952971Z","title":"Self-attentive residual decoder for neural machine translation","venue":null,"work_id":"2fa9d7cd-ed0b-49b2-9fb1-2adcc83a94ac","year":2018},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.508196Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:f6c72389ad5d213131b0c04e25da23b13325bb3e48f996b84e5dbb419a2007bf","observation_id":"903df40b-ff6d-42fb-9d26-5f8324c40239","resolution":{"observed_at":"2026-08-14T10:10:25.958464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.512436Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.512436Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:8fbfea9437a5d31c8d55e206fcbe39b478b6f166fdc377921b4de25cd2ee890c","observation_id":"fd63e46d-21df-4b2a-82a9-27706fe3a829","resolution":{"observed_at":"2026-08-14T10:10:25.512436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.04304","last_updated":"2017-11-13T20:11:26Z","snapshot_observed_at":"2026-08-14T21:01:16.837760Z","submitted_at":"2017-05-11T17:39:35Z","title":"A Deep Reinforced Model for Abstractive Summarization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.04304","snapshot_observed_at":"2026-08-14T10:10:25.516022Z","title":"A deep reinforced model for abstractive summarization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.516022Z"},"links":{"cited_paper":"/paper/1705.04304","citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:114cc8f59ebf5160ca70747cee4eb3d1d62c750aa40de8acf1954da9e58ac0e3","observation_id":"5200e4b3-4646-49a8-9b4f-64760c5b6bc2","resolution":{"observed_at":"2026-08-14T10:10:25.516022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.520625Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.520625Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:67130b45a2b360103a64ff4cd7c4e93fe413bb42f6edea42d3172870235f9558","observation_id":"6a60cba0-51ea-408a-8349-107a4ae8e020","resolution":{"observed_at":"2026-08-14T10:10:25.520625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.918794Z","title":"Self-critical sequence training for image captioning","venue":null,"work_id":"21592548-416e-4be4-a0ae-df2bcc35f52f","year":2017},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.524282Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:3651a05f3547a06fa7434f89fb0e1efb202f63ad7ffb610c5fdfbe83acd3bff4","observation_id":"701dd51b-12de-41d6-a317-12b966bd5361","resolution":{"observed_at":"2026-08-14T10:10:25.923757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.906899Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":"fb012bd3-11a7-4a51-86c5-2fd8341d4d87","year":2015},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.527810Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:5004e289335d5b5ec6a9cd2b655a547f16517e14d31c35450ce7420b7ae49047","observation_id":"0b689770-ffef-49a6-a822-b5b585fdbb08","resolution":{"observed_at":"2026-08-14T10:10:25.911063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.893464Z","title":"Sequence to sequence learning with neural networks","venue":null,"work_id":"e9dbba6a-61aa-4125-b368-9ecc8825fc68","year":2014},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.531766Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:98221f28297b0cd79110f3ec24b0adcebccbb469e7fdb5c2e226f2ef19cde227","observation_id":"0e95b271-1c67-446d-b233-54dee5e6d62b","resolution":{"observed_at":"2026-08-14T10:10:25.898065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.878772Z","title":"Inception-v4, inception-resnet and the impact of residual connections on learning","venue":null,"work_id":"51a8d0e4-039d-4e8f-a5f2-de5e9b83d614","year":2017},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.535706Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:961533e1ceea7eb90aabc7deabdda5eb98c86309a417f8cb7cb4dc05d4343429","observation_id":"cff34c2a-b767-4e78-a52d-2ecd2b633a7e","resolution":{"observed_at":"2026-08-14T10:10:25.884363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.865481Z","title":"Rethinking the inception ar- chitecture for computer vision","venue":null,"work_id":"79d5b844-a54e-416c-bdc3-d3b89962cd45","year":2016},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.539567Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:941d154bad382c7d4f0730921b4becb3332d170599aa2dfed26f485ec836b395","observation_id":"5d061fca-ddd9-40e0-90e8-f823a6103820","resolution":{"observed_at":"2026-08-14T10:10:25.869798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.01272","last_updated":"2016-04-22T11:13:11Z","snapshot_observed_at":"2026-08-14T22:15:43.364003Z","submitted_at":"2016-01-06T18:44:07Z","title":"Recurrent Memory Networks for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.01272","snapshot_observed_at":"2026-08-14T10:10:25.543213Z","title":"Recurrent memory networks for language modeling","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.543213Z"},"links":{"cited_paper":"/paper/1601.01272","citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:4a802c91f82a7be5a39fba01ccd04d34dc54a206f00e7c8843375717495bed2a","observation_id":"209574bf-4e9f-414e-9cf8-89df702a73f7","resolution":{"observed_at":"2026-08-14T10:10:25.543213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.852791Z","title":"Attention is all you need","venue":null,"work_id":"2cd21569-b2d6-42c1-83e0-c585d542441f","year":2017},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.547280Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:ce73f45560309236c325e8dca2c89101a0837cf715d67b81d020fc62c441df89","observation_id":"ffc845a7-449d-486a-b412-7274288cb82c","resolution":{"observed_at":"2026-08-14T10:10:25.857412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.839515Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":"0779c08a-be9f-4223-be59-2c1bb6ee64db","year":2015},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.550876Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:e4b3b996df76e3f76c772a36c5684f4aacf9e8d7e66093dfe574144e3c57d3dc","observation_id":"c47866d5-d4a1-4638-bfcd-f86fa50d344f","resolution":{"observed_at":"2026-08-14T10:10:25.843786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.826599Z","title":"Show and Tell: A Neural Image Caption Gen- erator","venue":null,"work_id":"54b4a04a-f04f-4b67-85d2-2634c3ed466e","year":2015},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.554672Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:af9612c8ace4a9e52259810793efcc10224b8cc41595073a224f0aac340ac8e8","observation_id":"faf74e05-ed2a-4af6-957c-f1f34869cdb1","resolution":{"observed_at":"2026-08-14T10:10:25.830818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.813894Z","title":"A learning algorithm for continually running fully recurrent neural networks.Neu- ral computation, 1989","venue":null,"work_id":"e96212c5-c661-4391-b803-e6d3a838d2cd","year":1989},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.558197Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:0bf8f4739baedf7f3bf92fab001e9c567b9015b6fc01ad24f8b3b9441d99636b","observation_id":"ea70c44e-983c-4322-94bb-3f8613abfe04","resolution":{"observed_at":"2026-08-14T10:10:25.818245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.800975Z","title":"What value do explicit high level concepts have in vision to language problems? In CVPR, 2016","venue":null,"work_id":"91e63bb0-83e0-4421-b8d9-577fcf1fa04d","year":2016},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.562481Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:830146731e329a5c109e9ec6dfaa444459303e91fa29e58dffb18b963aff6343","observation_id":"5f3bfba9-b58a-428e-8626-5ed79ef35b55","resolution":{"observed_at":"2026-08-14T10:10:25.805462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.788159Z","title":"Zemel, and Yoshua Bengio","venue":null,"work_id":"7113177a-cecf-4bf3-a8ba-8905f1678c3c","year":2015},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.566447Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:cad286e2994e54a52e4534b1b8189dcaf47474be3a7194ff72ed7ebcf539a73b","observation_id":"a3324deb-09da-4a73-987d-fccb895d2b8f","resolution":{"observed_at":"2026-08-14T10:10:25.792751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.775481Z","title":"Corpus-guided sentence generation of nat- ural images","venue":null,"work_id":"6cc019ce-dba9-4b39-9760-111af8772dc1","year":2011},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.570421Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:5efdae878b7725858fcf13a4332a8b300f8993dfa1d6d74851b90f093ddabe37","observation_id":"ee8ea058-6ead-4ea9-9657-46371f50c7f4","resolution":{"observed_at":"2026-08-14T10:10:25.780216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.762943Z","title":"Review networks for caption gen- eration","venue":null,"work_id":"600824d7-a9f4-435c-bd53-d289b79f6ece","year":2016},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.574326Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:296f13d5336ab2915502e5b47bce5445900c4d029260b000f9a206999b41c66a","observation_id":"ce5d8bba-c32d-405b-8f9c-97901cf693c5","resolution":{"observed_at":"2026-08-14T10:10:25.767229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.578379Z","title":"Exploring visual relationship for image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.578379Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:117b2bd4b48e4e2c1e1fe8c4faa53d1ee402cd0861bae0e69dfd9421e8963e44","observation_id":"dd1d67dd-4a6a-4624-b363-d3a05a5ff7f1","resolution":{"observed_at":"2026-08-14T10:10:25.578379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.739870Z","title":"Boosting image captioning with attributes","venue":null,"work_id":"7d225615-ac5c-4ecc-a401-880a46dc06b0","year":2017},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.583504Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:6057bf77573883d931de7edf0d4292198d3c945af15c429fdfabedc38fdc8ae5","observation_id":"d1473773-484a-4528-9823-d7cb3ca3eaed","resolution":{"observed_at":"2026-08-14T10:10:25.744593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.724526Z","title":"Image captioning with semantic attention","venue":null,"work_id":"fb138c91-7bed-4923-9b86-41708d5e8668","year":2016},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.587920Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:5217e7a212546cb37de965f74d764ca1f852fc4ad8a9fa8a66e8e62ae602a07d","observation_id":"47e76712-0b86-4146-8995-ad8e2d0400f7","resolution":{"observed_at":"2026-08-14T10:10:25.730387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:10:25.708838Z","title":"Mattnet: Modular at- tention network for referring expression comprehension","venue":null,"work_id":"f05688fd-9f2c-4d8b-9891-1e87c6d6d95c","year":2018},"citing_paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T10:10:25.592243Z"},"links":{"citing_paper":"/paper/1908.11824"},"observation_digest":"sha256:17ed2aa91c090ad27c5671921d1f62211b82d3fa55f3bd4995a154f55c451a3c","observation_id":"f349040f-4777-4371-a385-7ba286deb8bf","resolution":{"observed_at":"2026-08-14T10:10:25.714925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.11824","last_updated":"2019-08-30T16:25:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T10:04:09.728909Z","submitted_at":"2019-08-30T16:25:55Z","title":"Reflective Decoding Network for Image Captioning"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:1908.11824."}