{"as_of":"2026-08-16T20:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f026e2cd9bdf8df70acdbbce74f053f9da0bfe774a0b2b4fc593e35837b49ec5","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T12:55:23.500601Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.06327/citation-record","integrity":"/paper/1908.06327/integrity","json":"/paper/1908.06327/citation-record.json","paper":"/paper/1908.06327"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.905996Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":"1bf719d9-459b-4622-9de4-348a7c8eaf66","year":2018},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.047017Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:357b79323ac5b49f31e05a2de56a9d88c84a3baeede5105009035eaffabd62cd","observation_id":"05673b87-a82d-4201-9bbe-87ef0e12a7fd","resolution":{"observed_at":"2026-08-14T12:55:24.912558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.880857Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"30739961-2694-444b-ad62-e3da90f81b62","year":2015},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.055821Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:5b9321d017a9d2bdbaf1efe199e9a6cecd4444ee795d1743a93f79fe1e02194d","observation_id":"0f11676c-966c-4cd1-bea7-c7516614e435","resolution":{"observed_at":"2026-08-14T12:55:24.887641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.859201Z","title":"A neural probabilistic language model","venue":null,"work_id":"b83b1382-b27b-4caa-bc80-bf54ef5cc785","year":2003},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.062557Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:d729b3e5fc1c0424d7eabada0bfb72cb639f4cbe7d401074ffef1aa45c5d65f6","observation_id":"89bd2507-b301-4f47-8689-f1c83873daf0","resolution":{"observed_at":"2026-08-14T12:55:24.867887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.839776Z","title":"Enriching word vectors with subword infor- mation","venue":null,"work_id":"9314c06f-7974-4cdb-b773-1624efa5169f","year":2017},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.070702Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:0b468a2a2eeacca012fa481583ea48e3f6f5f66fe7bff95cc9cfd8cc52a9202e","observation_id":"d5c0a084-e680-44f1-a8a0-4f8024d0e059","resolution":{"observed_at":"2026-08-14T12:55:24.845577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.822320Z","title":"Temporally grounding natural sentence in video","venue":null,"work_id":"8efa96f6-1682-47db-bc1b-770e62c9d504","year":2018},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.079155Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:807773ed965858d784702566991862311f0ebc68a910f81a716b1a080b3f8ca5","observation_id":"ab2d3489-2386-4ddc-9cdd-7fa02a0ec28a","resolution":{"observed_at":"2026-08-14T12:55:24.828470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.802329Z","title":"Query-guided regression network with context policy for phrase grounding","venue":null,"work_id":"1d0a4c8c-03f3-4ebd-9f64-62177e30ed5b","year":2017},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.090922Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:f3c529463c3ee85be0dec9cc3620ce19ebbc5db30dac600c23ad3f3bc39e5c5b","observation_id":"fbe12f15-649e-4df4-9c64-e151f6533914","resolution":{"observed_at":"2026-08-14T12:55:24.808939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.11439","last_updated":"2018-04-07T01:49:44Z","snapshot_observed_at":"2026-08-14T19:30:43.385978Z","submitted_at":"2018-03-30T13:15:56Z","title":"Regularizing RNNs for Caption Generation by Reconstructing The Past with The Present","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.11439","snapshot_observed_at":"2026-08-14T12:55:23.100124Z","title":"Regularizing rnns for caption generation by reconstruct- ing the past with the present","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.100124Z"},"links":{"cited_paper":"/paper/1803.11439","citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:1a5bcdc3ea94066853464bf60c14f6fabaf2a021d5d313b770a5f1ee7e6e6f9a","observation_id":"a8703fea-8a77-4915-a0c0-19963663f8b8","resolution":{"observed_at":"2026-08-14T12:55:23.100124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.784276Z","title":"Supervised learning of univer- sal sentence representations from natural language inference data","venue":null,"work_id":"a70a1cb7-baed-447e-8d7a-431298dc21a8","year":2017},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.112546Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:b0835be5ed714663d5b2483e4371fa17fbb331c0f4a7e5a6392e6fa18e39cf1a","observation_id":"bf2fc75b-c4f4-4940-b986-80fedc702e69","resolution":{"observed_at":"2026-08-14T12:55:24.791142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.765618Z","title":"ImageNet: A Large-Scale Hierarchical Image Database","venue":null,"work_id":"b489739d-fed6-436f-beee-7180005acefc","year":2009},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.119226Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:3031f3efacd76545bccde0fbc89cfb32071b3f6f087233fd334274ace29aaa1b","observation_id":"d091ef20-4eeb-486d-bde9-d2b8fe74968b","resolution":{"observed_at":"2026-08-14T12:55:24.772027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-14T12:55:23.125805Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.125805Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:5ff1741d5b96cd75a18ee919e7441eab6553d74d629664f459d0f037252573df","observation_id":"8e844827-57f9-42a7-ab3a-fe05ba3d444a","resolution":{"observed_at":"2026-08-14T12:55:23.125805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.749902Z","title":"Fleet, Jamie Ryan Kiros, and Sanja Fidler","venue":null,"work_id":"bab01228-2c38-45f0-a402-6aa9062db5ba","year":2018},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.132127Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:501345f0bdd43f01cb1e2c9d6bd98bdee6f52c72f2bf6b17e031fc015d2315ac","observation_id":"1d984e53-44a1-4369-bcc9-af0b77a5c762","resolution":{"observed_at":"2026-08-14T12:55:24.754694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.733517Z","title":"Image caption- ing with word level attention","venue":null,"work_id":"4aa1e4e1-42d6-4d73-a53f-0810aa0f2099","year":2018},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.139969Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:c1df5eaf4f6ee43f25780b6737c2aca707b10220a41839a967eb8dc019f80d15","observation_id":"31fb7634-5fc7-4cb4-91f8-e7b64e8ee2a1","resolution":{"observed_at":"2026-08-14T12:55:24.738823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.4952","last_updated":"2015-04-14T18:05:07Z","snapshot_observed_at":"2026-08-14T23:11:09.588292Z","submitted_at":"2014-11-18T18:23:45Z","title":"From Captions to Visual Concepts and Back","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.4952","snapshot_observed_at":"2026-08-14T12:55:23.145294Z","title":"From captions to visual concepts and back","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.145294Z"},"links":{"cited_paper":"/paper/1411.4952","citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:edc9e870c936b7ed23e99089d8aa176d7ca6622bbc225718898bd3f100eb4741","observation_id":"41083366-a5bc-4ef9-8920-655086707a8e","resolution":{"observed_at":"2026-08-14T12:55:23.145294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.716309Z","title":"Jauhar, Chris Dyer, Eduard Hovy, and Noah A","venue":null,"work_id":"b5d43f99-9067-436e-826f-1b2a72724d55","year":2015},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.153830Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:b4cf7c437fdf392f4e35609c8f1e74ce4d87d882d2a52e46eae7d30db0b9acbf","observation_id":"1e725e87-36f0-47ca-82ae-bc55c3c6cc64","resolution":{"observed_at":"2026-08-14T12:55:24.722809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.698248Z","title":"Multimodal com- pact bilinear pooling for visual question answering and vi- sual grounding","venue":null,"work_id":"884f0f21-1c51-4b4e-b75d-bc1250b392cb","year":2016},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.161983Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:ea493746c213a26f2dc9d0fbc5752136fc3d0c4cc4e50fc1e65e5a5a59ab8ecd","observation_id":"ac24baa3-5866-4b1c-ad39-21dbeb8fb9ee","resolution":{"observed_at":"2026-08-14T12:55:24.704458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.679434Z","title":"Making the V in VQA matter: Ele- vating the role of image understanding in Visual Question Answering","venue":null,"work_id":"7ffc8ffb-c9f2-4dd8-82d6-e5f9e018c7a5","year":2017},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.170606Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:0562a3975f06c23f23f04ca0d1ed4318f55b208388b983534ba1f77831beba4b","observation_id":"566b3310-f018-4f6b-9d72-1b3013340191","resolution":{"observed_at":"2026-08-14T12:55:24.684423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.658441Z","title":"The IAPR TC-12 benchmark – a new evaluation resource for visual information systems, 2006","venue":null,"work_id":"f975bb94-8a5a-4f53-ae85-35ceb6fc9629","year":2006},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.176625Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:cec4a92a3dc913bf1600e3e379f80060351f0b59694aea6c1d7578314a730ce7","observation_id":"7e5fef83-c6f5-476a-a334-993db1c1c0b4","resolution":{"observed_at":"2026-08-14T12:55:24.665763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-14T12:55:23.183630Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.183630Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:9ebc31ba98f61b8989bc0042c74e84785dbdd3a3a81cffa5127c44eace89cb8f","observation_id":"f5ae9acc-ce98-472c-be11-1a13d1a8cb4e","resolution":{"observed_at":"2026-08-14T12:55:23.183630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.637805Z","title":"Localizing mo- ments in video with natural language","venue":null,"work_id":"6d1ba842-7291-4bb5-b028-8752dfdb8733","year":2017},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.189964Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:75bdac371d05a4a3a707ea9a05c5dec19cbe96fc6e6dded93ccc43dda4d7b82e","observation_id":"1fe59da6-8953-4961-8f77-63d0e0c7e864","resolution":{"observed_at":"2026-08-14T12:55:24.644666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.619909Z","title":"Discriminative learning of open-vocabulary object retrieval and localization by neg- ative phrase augmentation","venue":null,"work_id":"4726bbd0-f49d-46bf-b6d1-b67dcde1311f","year":2018},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.195987Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:87dc133ee40436e327e8236b221859f6a1a7e39df233bbdf899952dd832b196c","observation_id":"1e0d6761-3846-4a5e-ad03-c172169b4887","resolution":{"observed_at":"2026-08-14T12:55:24.626304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.05526","last_updated":"2017-09-11T22:22:59Z","snapshot_observed_at":"2026-08-14T21:06:08.859450Z","submitted_at":"2017-04-18T20:57:32Z","title":"Learning to Reason: End-to-End Module Networks for Visual Question Answering","version":3},"cited_work":{"arxiv_id":"1704.05526","doi":null,"metadata_source":"pith","pith_arxiv_id":"1704.05526","snapshot_observed_at":"2026-08-14T12:55:23.653617Z","title":"Learning to Reason: End-to-End Module Networks for Visual Question Answering","venue":"cs.CV","work_id":"d8061c13-c8cd-4fa2-bcaf-45274d96f1e9","year":2017},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.201706Z"},"links":{"cited_paper":"/paper/1704.05526","citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:80394093f72f1f7cc23ec78d2ceaaea0b0cb6146ff1febd5d607cd86404f41ac","observation_id":"4a68563e-2733-42f1-ac22-525f153f626d","resolution":{"observed_at":"2026-08-14T12:55:23.659179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.595386Z","title":"Natural language object retrieval","venue":null,"work_id":"a96f4175-c9a6-4a7c-a660-cacb40766230","year":2016},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.210194Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:89250a206f39bd0c2a5d36e39ce1fcc772e302437ef29561567c7623dfeecfb8","observation_id":"4532e726-6089-4cc2-8703-1788be8043f1","resolution":{"observed_at":"2026-08-14T12:55:24.603925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.575848Z","title":"Learning semantic concepts and order for image and sentence matching","venue":null,"work_id":"2b4bb77e-af14-4150-a4a2-1eb096d6c2a7","year":2018},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.219108Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:83ddc7d93d9ddd57481ac42b151173e81c1d5779328ac2088ab7ff2b4e946c4a","observation_id":"bcebb588-d855-4324-80a5-dbd091c40b33","resolution":{"observed_at":"2026-08-14T12:55:24.582211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.552703Z","title":"ReferItGame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"6b77f359-b070-48ee-8644-43b7c6a721f0","year":2014},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.227241Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:1bece869f05d880e1c212c0c09047a47d68b5761ec6cd4025353b9b020b1be65","observation_id":"3da144ea-c279-41c1-8b3a-de7ec0cc75de","resolution":{"observed_at":"2026-08-14T12:55:24.559771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.530576Z","title":"Learning image embeddings using convolutional neural networks for improved multi- modal semantics","venue":null,"work_id":"147d9e9d-41c6-42be-b0b8-a69feebf2475","year":2014},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.236533Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:9a629c9ee4b325c559bc0bfebb81e965c16b5edf67ab1732acf298c738558f01","observation_id":"d74c7a17-770d-44ef-a8e3-d27874c6b790","resolution":{"observed_at":"2026-08-14T12:55:24.537178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.507105Z","title":"Bilin- ear attention networks","venue":null,"work_id":"ea58a868-0505-4b26-806f-418d40a7b456","year":2018},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.245501Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:3b20a7d435cf1182a855595596a9c7f63279f42bf496a988ac314f1c2f25efb2","observation_id":"2145237e-f086-4e70-b827-b42a8707e770","resolution":{"observed_at":"2026-08-14T12:55:24.513298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.487463Z","title":"Fisher vectors derived from hybrid gaussian-laplacian mixture mod- els for image annotation","venue":null,"work_id":"1b78a8d4-275a-425e-b9aa-eb843b8e2f91","year":2015},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.253884Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:6f80e527e2ce05c9b05973a771639609bf2218b20522be38b45caada61451bc0","observation_id":"9c04970d-3c76-4a08-a3e2-e2b166fef98a","resolution":{"observed_at":"2026-08-14T12:55:24.493942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.469678Z","title":"What are you talking about? text-to-image coreference","venue":null,"work_id":"26d6b9b2-9ea3-461a-b94d-f00dc67b08b3","year":2014},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.269286Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:c5d22fea88e119e02b1636a55aac3d1c115e0cee70252de2b01aaad0a458d71f","observation_id":"f5fff47a-0b68-4a8a-82ad-82aa90750d1f","resolution":{"observed_at":"2026-08-14T12:55:24.475489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.451929Z","title":null,"venue":null,"work_id":"be2b56ad-dcfe-4579-b27d-96527d0132c7","year":2016},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.276136Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:e0c4ec6488495734ce9136c93c86d83f120d873ecb2fffdf29bf209d0255fe4c","observation_id":"5ce4735f-a3da-4ec2-b131-0605beffa216","resolution":{"observed_at":"2026-08-14T12:55:24.457860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.434799Z","title":"Dense-captioning events in videos","venue":null,"work_id":"a88c60fe-41f3-49df-baa8-2ed1e5977a50","year":2017},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.286192Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:82745f2ae39c20afda332773fa8fac4b8d8f8b8a81bf040e21b35edd989b5593","observation_id":"dbe27d71-5d1d-4697-bf10-f7844820c790","resolution":{"observed_at":"2026-08-14T12:55:24.439975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.413574Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":"3abb09fa-ed5a-4856-a9aa-8f8bc8a7a57c","year":2016},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.292583Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:38aa9ad906eba763341bd6209ba2a076fba812d95492612a3226c3af95067548","observation_id":"37fb26c6-171b-4fab-90a1-97027e4e11ef","resolution":{"observed_at":"2026-08-14T12:55:24.420296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.388433Z","title":"Combining language and vision with a multimodal skip- gram model","venue":null,"work_id":"252f6073-bbb3-433c-9a70-05b0e04d07df","year":2015},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.298583Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:88e3e91661634d113553675011f0703a04e8de04f71dd56426b1185949cb9da0","observation_id":"687c6c77-9a4f-4a59-9f7d-2f9370603f42","resolution":{"observed_at":"2026-08-14T12:55:24.395183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.369702Z","title":"Stacked cross attention for image-text matching","venue":null,"work_id":"3d4a2d2e-f00f-4721-8fdd-375280dd2e7e","year":2018},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.303367Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:826e8384f7e9ba464b090c0cedeb6c8a4d2ffeaad1adae7644c85b97c9aaf3cc","observation_id":"df411384-814f-44b4-b702-2073aeab690f","resolution":{"observed_at":"2026-08-14T12:55:24.375515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.349130Z","title":"RNN ﬁsher vectors for action recognition and image annotation","venue":null,"work_id":"b4f2a2cb-bb76-465c-ab20-b1e964e49079","year":2016},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.309232Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:220324f2a8a9123ba035856812edc25c922555e5f5fe8b8615abc3ee41d8a263","observation_id":"386b0541-5907-45e2-a556-457daa4a8424","resolution":{"observed_at":"2026-08-14T12:55:24.356331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.327516Z","title":"Microsoft COCO: Common objects in context","venue":null,"work_id":"dc8e1e94-e2fa-44d6-b213-77067daec299","year":2014},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.315705Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:e5136c2eebf5f9cef2a2b7ad513f2df7aa940bd0904f2d60935a260c9a6a64a4","observation_id":"8bf4674e-a7d5-46c6-8522-5375798e22e8","resolution":{"observed_at":"2026-08-14T12:55:24.333341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.308932Z","title":"Temporal modular networks for retrieving complex compositional activities in videos","venue":null,"work_id":"a999c9b5-75c2-42a0-a9b3-30b6f499e0b5","year":2018},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.321889Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:18cf485fdee04c05279c58bc40fd5888176b70fa7b952393b0507c1a5396ac34","observation_id":"a25c6695-f085-4a41-a142-08bf4f197a30","resolution":{"observed_at":"2026-08-14T12:55:24.314501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.289382Z","title":"Hierarchical question-image co-attention for visual question answering","venue":null,"work_id":"433ce8bd-6997-43ba-8707-6d4009e1792b","year":2016},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.328158Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:4e1d48eeee0bd7f2475808785910bcb9d902ca28c12fa2adea346a8c96dbdd86","observation_id":"8424463c-16d3-46a9-ab08-3e177bb4403b","resolution":{"observed_at":"2026-08-14T12:55:24.295145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:23.334090Z","title":"Packnet: Adding mul- tiple tasks to a single network by iterative pruning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.334090Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:aaf13f388179e5d3ee412293d2b6942605a8a7dcf3dfa331a899f4f8a0810de9","observation_id":"05ed0127-a0b4-4ec8-9cad-52819f2bcd92","resolution":{"observed_at":"2026-08-14T12:55:23.334090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.246951Z","title":"Linguis- tic regularities in continuous space word representations","venue":null,"work_id":"3a1025ae-c2b9-4242-97d8-2fbe495815bc","year":2013},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.339772Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:6760233edb9942afa15a7377b136d525f1ee7a4031d75467e4c68d4d2344161f","observation_id":"04a7c62b-55d9-40ab-a231-f6312e8a1267","resolution":{"observed_at":"2026-08-14T12:55:24.254754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.227086Z","title":null,"venue":null,"work_id":"74e5c838-1ed4-43c3-95b5-cb46ea9afb0c","year":1995},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.347990Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:99add0dffa11c7bc78f63ce9daad28a9d14e48a0f36317cc0b54778d12a731fc","observation_id":"26bcd364-e83d-4d8a-acac-ec59d6279433","resolution":{"observed_at":"2026-08-14T12:55:24.233287Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.207156Z","title":"Dual attention networks for multimodal reasoning and matching","venue":null,"work_id":"162fdefd-4a4f-4d4b-8cf8-f468038c9b55","year":2017},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.353879Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:092cd1792d2a04e443ec5a32e4befa7891004f2a9ad9e9f8854f0ea9f60450c3","observation_id":"b2db0d93-8c36-423a-97a8-ba227b9e1782","resolution":{"observed_at":"2026-08-14T12:55:24.213338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.181537Z","title":null,"venue":null,"work_id":"da61e122-d998-4024-87cd-c4df14efb307","year":2014},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.359422Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:be5a1b5c7cc9d3d846b7a53894ebeadc19012afbab23a0b8a63bafe619612ff7","observation_id":"bd9369d1-8666-448b-95d1-542dfb020ae4","resolution":{"observed_at":"2026-08-14T12:55:24.192144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.157934Z","title":"Peters, Mark Neumann, Mohit Iyyer, Matt Gard- ner, Christopher Clark, Kenton Lee, and Luke Zettlemoyer","venue":null,"work_id":"e5b5ed41-b89a-490a-adc2-5472cb143746","year":2018},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.365317Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:5e0f0749c8b30eb43ae80c71536dc6985cd4129defe24088e553068000bf7118","observation_id":"f140c4de-9280-4c0b-bf53-7002cf5ad21d","resolution":{"observed_at":"2026-08-14T12:55:24.167686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.137264Z","title":"Plummer, Paige Kordas, M","venue":null,"work_id":"954cb9ad-3fe1-44db-862d-cc76ad69b31a","year":2018},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.370095Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:90f226a414cf4f4ffe746bf7dbca1309feb9d678ffe914cc826bdf1a7c1750b1","observation_id":"7076aa22-6460-4082-9a09-ad8f74d64fa5","resolution":{"observed_at":"2026-08-14T12:55:24.142941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.117699Z","title":"Plummer, Arun Mallya, Christopher M","venue":null,"work_id":"9ab630d3-9a0e-4ed6-b71c-677b91f0da5e","year":2017},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.374819Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:2174c1cbcba492ea6dbec9d1f65e9017154f9c83474f292df6ff0c6bd11d8721","observation_id":"cfd22438-7b2a-40fb-a714-30a569c54c0f","resolution":{"observed_at":"2026-08-14T12:55:24.123491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07212","last_updated":"2020-10-12T19:13:55Z","snapshot_observed_at":"2026-08-14T17:57:23.430282Z","submitted_at":"2018-11-17T19:45:05Z","title":"Revisiting Image-Language Networks for Open-ended Phrase Detection","version":3},"cited_work":{"arxiv_id":"1811.07212","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.07212","snapshot_observed_at":"2026-08-14T12:55:23.622120Z","title":"Revisiting Image-Language Networks for Open-ended Phrase Detection","venue":"cs.CV","work_id":"337e5da0-f79e-4adb-9683-f84118f7bb24","year":2018},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.380013Z"},"links":{"cited_paper":"/paper/1811.07212","citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:5391fc85150f89a791e733f8ec945316aea10de750d77a8cdb4e29e12dd70b10","observation_id":"8aac6b13-e821-425a-834e-bee868f96b59","resolution":{"observed_at":"2026-08-14T12:55:23.630735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.088090Z","title":"Plummer, Liwei Wang, Chris M","venue":null,"work_id":"e570719f-e6aa-4dad-9b7f-7bdf6e29b30a","year":2017},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.387038Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:5b0dad08874383fcf64a3369dea043caebdb19bdad239fb84b6ecf867dc5a734","observation_id":"509d86fb-b9fe-4d8c-9a8a-1d5a455f0f75","resolution":{"observed_at":"2026-08-14T12:55:24.094583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:23.392265Z","title":"Faster R-CNN: Towards real-time object detection with re- gion proposal networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.392265Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:375048356f0a44b98907bf03be80c100852a468e0e5cd8af9b3e3696ce82161d","observation_id":"945de334-2d37-4b1a-9142-6b0bd7908fb8","resolution":{"observed_at":"2026-08-14T12:55:23.392265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.052666Z","title":"Grounding of textual phrases in images by reconstruction","venue":null,"work_id":"c46e452d-8906-4489-a653-fe791d32c1e1","year":2016},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.397711Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:848e7accddda200ab3b5882c61bc08f19a9c34a0fdebc2ba4f63c6b33508074a","observation_id":"6e9e5436-225a-44a2-943e-198234c8e4e8","resolution":{"observed_at":"2026-08-14T12:55:24.061774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.032496Z","title":"Training region-based object detectors with online hard ex- ample mining","venue":null,"work_id":"8ec7b227-c49f-4e43-a690-baa38f21c855","year":2016},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.403258Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:c21a827ed38c3db7010e31d739ad75add777e82a96ace94a6bd1844888715f08","observation_id":"a313310f-a7d4-49ac-a599-00aeea4854a7","resolution":{"observed_at":"2026-08-14T12:55:24.038650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-14T12:55:23.409458Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.409458Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:e2204c474a6a473924abe8b8e0aa4a4a383c70472554eb963a48167263fbb954","observation_id":"99f44b98-3602-4513-a8d5-3422b4343ac7","resolution":{"observed_at":"2026-08-14T12:55:23.409458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:24.014650Z","title":"Plummer, Svetlana Lazebnik, Alex C","venue":null,"work_id":"667ef531-26ca-45f7-bf6d-239b1ed35a49","year":2016},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.415882Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:03b7080e202f6022eddba3a7ca680ed035931e49772a020946eeaf41ea43c56f","observation_id":"a131315e-8d8b-4b8a-892d-4cfaf4fde43a","resolution":{"observed_at":"2026-08-14T12:55:24.020432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:23.995895Z","title":"Attention is all you need","venue":null,"work_id":"1b71a69a-f4f8-4e4e-8bfd-114e317f6650","year":2017},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.420889Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:3fc1267d8a64b023f549615b7a3a1000b59661449fe6e39777d463ef84ee272e","observation_id":"9818656e-5c95-4988-bb4e-1ffbebaae2ef","resolution":{"observed_at":"2026-08-14T12:55:24.002290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:23.977569Z","title":"Order embeddings of images and language","venue":null,"work_id":"41990796-1647-43d0-b945-cce6311ca3e6","year":2016},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.426819Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:39d2d3f31a47b0e7f4768f22eb4a4fa9a3ed0ba437a03acb4576f9b386394852","observation_id":"de8cd408-4458-445d-b9f7-a63d6acca6b0","resolution":{"observed_at":"2026-08-14T12:55:23.983503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:23.959741Z","title":"Se- quence to sequence – video to text","venue":null,"work_id":"e1251c3b-5e93-4e17-8a48-46b7407bc5a2","year":2015},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.432884Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:ae6faeea9cc94b5b79c75601af554fe520b8cfb1b6fa05d3da23074947717017","observation_id":"009b7f1a-4551-404e-a700-d42edb4c3bf2","resolution":{"observed_at":"2026-08-14T12:55:23.966080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:23.940789Z","title":"Show and tell: A neural image caption gen- erator","venue":null,"work_id":"750198eb-a158-43d7-b6ea-0932d17d488f","year":2015},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.438878Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:f2238a97c40915ba52914eb799fb59c3e372429d410cc78edb09099258b509f1","observation_id":"df279ad1-d9dd-4e1b-b696-b3e876aa03f6","resolution":{"observed_at":"2026-08-14T12:55:23.946461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.03470","last_updated":"2018-05-01T18:21:59Z","snapshot_observed_at":"2026-08-16T19:29:35.026077Z","submitted_at":"2017-04-11T18:00:25Z","title":"Learning Two-Branch Neural Networks for Image-Text Matching Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.03470","snapshot_observed_at":"2026-08-14T12:55:23.444026Z","title":"Learning two-branch neural networks for image-text match- ing tasks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.444026Z"},"links":{"cited_paper":"/paper/1704.03470","citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:fff5c7cdc4bb95504af9610df1dc456fcf2ff232ed39742bd4e77a1634414545","observation_id":"ad58edcd-0668-4e98-8407-2d8bcbd3612c","resolution":{"observed_at":"2026-08-14T12:55:23.444026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:23.924220Z","title":"Structured matching for phrase lo- calization","venue":null,"work_id":"5c3c9986-877b-49b2-8a96-b67d48cb557e","year":2016},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.449539Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:0eb9006464e329e608d5f5af6857d78ed157e0e4897baa845f6ce25c13a89317","observation_id":"7db42155-4366-408f-8a05-aa843f10d37d","resolution":{"observed_at":"2026-08-14T12:55:23.929206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:23.900328Z","title":"R-C3D: Region convolutional 3d network for temporal activity detection","venue":null,"work_id":"78ded306-0bdc-4083-a13a-8863fc0a0cc1","year":2017},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.455396Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:186c3ec21d5c32727757292198b0a730236bb1c259b5f4ca4c512740dc62e8e3","observation_id":"e70d0a93-a244-4885-bca8-0a5c581ae3f1","resolution":{"observed_at":"2026-08-14T12:55:23.909379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:23.881724Z","title":"Plummer, Leonid Sigal, Stan Sclaroff, and Kate Saenko","venue":null,"work_id":"a9d50eec-e17f-44e0-8c8c-b0f0c971e635","year":2019},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.461729Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:a7793371777b9355d23021fca32384f878c1d2b42f8f4d521daa1b20cb02aeb3","observation_id":"bd3d6b8c-2b67-456d-96e2-d2d4b6d66c94","resolution":{"observed_at":"2026-08-14T12:55:23.887763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03044","last_updated":"2016-04-19T16:43:09Z","snapshot_observed_at":"2026-08-14T23:00:34.588086Z","submitted_at":"2015-02-10T19:18:29Z","title":"Show, Attend and Tell: Neural Image Caption Generation with Visual Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03044","snapshot_observed_at":"2026-08-14T12:55:23.467869Z","title":"Show, attend and tell: Neural image caption generation with visual attention","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.467869Z"},"links":{"cited_paper":"/paper/1502.03044","citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:0382d4f03c844854508c403b5aaeb04fa77c86c1e0eaea317adc23ab49d6765b","observation_id":"da96f9cd-3bbe-4139-b593-a2d04f5f36d3","resolution":{"observed_at":"2026-08-14T12:55:23.467869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:23.855231Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions","venue":null,"work_id":"0dce9a8f-11bb-4b90-9b83-80b6dc3137bc","year":2014},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.473314Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:e2e1dade38d432e830e9a731f8d022fe40e0a432e531a4535eb679ba5dc791d3","observation_id":"6f94ca81-2d51-44e9-be28-6dcc154fbb02","resolution":{"observed_at":"2026-08-14T12:55:23.862689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:23.833877Z","title":"Berg, and Tamara L","venue":null,"work_id":"ff6f9f32-4bc8-4920-82de-c1970246f9ab","year":2015},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.478663Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:5bf5ab7eaf1a2907718eea9979af236f82b286ea129fdaf41dc6ed19c3670fb0","observation_id":"6c272654-be03-4108-9cf3-006b9febd61f","resolution":{"observed_at":"2026-08-14T12:55:23.840153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:23.815934Z","title":"Improving lexical embeddings with semantic knowledge","venue":null,"work_id":"12c9d4d6-d5d5-4900-9b95-1b2287477128","year":2014},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.483556Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:1d043729f871d2b7a3d7358074f56194d843be94e999097b9c07c0dee3510f7a","observation_id":"903b884c-687b-410f-8545-e29bc97917a5","resolution":{"observed_at":"2026-08-14T12:55:23.821753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:23.796344Z","title":"Yin and Yang: Balancing and an- swering binary visual questions","venue":null,"work_id":"84317171-92fc-40a6-ace9-165eb26dad32","year":2016},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.489209Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:94f0e46323e08cc06ac835e227d295bacbdd823772a265f0944992f2d9af8c31","observation_id":"a62bea2b-db37-4e5c-9800-fd8e0bd79d6b","resolution":{"observed_at":"2026-08-14T12:55:23.802530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:23.772070Z","title":"Deep cross-modal projection learning for image-text matching","venue":null,"work_id":"3ac94ea3-ae72-4462-9be7-37c85eea7774","year":2018},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.495332Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:c9bc4c5a6d9d92f1cecfc0282e7aec7f62a4100c75c33b6adde5e6ebe1352ba0","observation_id":"6d7a8d99-aafe-4639-a5cf-039c1f3f53fd","resolution":{"observed_at":"2026-08-14T12:55:23.778533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:55:23.745805Z","title":"Datasets Flickr30K [62]","venue":null,"work_id":"00fc70d0-5941-45bc-beda-7eb113d63166","year":null},"citing_paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-14T12:55:23.500601Z"},"links":{"citing_paper":"/paper/1908.06327"},"observation_digest":"sha256:349e47ae511b94aa9aa8e0126183d10153e7806b220b9aacbc44e568a191e7f9","observation_id":"68d03680-06a0-42a6-8649-2ed7420b9bad","resolution":{"observed_at":"2026-08-14T12:55:23.751362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.06327","last_updated":"2019-08-17T18:01:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T10:53:07.168621Z","submitted_at":"2019-08-17T18:01:27Z","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":53},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:1908.06327."}